中文

健康科学新闻稿夸张检测的半监督方法

计算与语言 2021-09-01 v1 机器学习

摘要

公众对科学的信任依赖于对科学论文诚实且事实性的传播。然而,近期的研究表明,新闻媒体倾向于通过夸大科学论文的发现来歪曲它们。鉴于此,我们形式化了科学传播中夸张检测问题并对其进行研究。尽管有大量科学论文以及关于它们的科普媒体文章,但这些文章很少包含指向原始论文的直接链接,使得数据收集具有挑战性。为此,我们从现有的关于科学论文新闻稿夸张的专家标注研究中整理了一组带标签的新闻稿/摘要对,适用于在該任务上基准测试机器学习模型的性能。利用来自本研究及先前科学夸张检测研究的有限数据,我们引入了 MT-PET,即模式利用训练(PET)的多任务版本,它利用来自互补完形填空式问答任务的知识来改进少样本学习。我们证明,无论是在数据有限还是主任务数据充足的情况下,MT-PET 都优于 PET 和监督学习。

关键词

引用

@article{arxiv.2108.13493,
  title  = {Semi-Supervised Exaggeration Detection of Health Science Press Releases},
  author = {Dustin Wright and Isabelle Augenstein},
  journal= {arXiv preprint arXiv:2108.13493},
  year   = {2021}
}

备注

Accepted to EMNLP 2021; 13 pages, 6 figures, 9 tables