中文

赋能事实核查者!Twitter上声明片段的自动识别

计算与语言 2022-10-12 v2

摘要

在COVID-19之后,医疗与政治声明的广泛传播导致错误信息与假新闻的大量增加。当前的流行做法是雇用人工事实核查者来高效分类与验证此类数据,以对抗这股充斥声明的错误信息浪潮。然而,信息传播的速度远超事实核查者的能力。因此,为协助人工事实核查者剔除多余内容,自动识别并提取帖子中值得声明的(错误)信息片段变得至关重要。本工作中,我们引入声明片段识别(CSI)这一新任务。我们提出CURT,一个在超过7.5k条推文上带有词元级声明片段的大规模Twitter语料库。此外,除标准词元分类基线外,我们还用DABERTa(一种基于适配器的RoBERTa变体)对我们的数据集进行基准测试。实验结果证明DABERTa在多项评估指标上优于基线系统,提升约1.5个点。我们还报告了详细的错误分析以验证模型性能及消融研究。最后,我们公开发布了全面的片段标注指南。

关键词

引用

@article{arxiv.2210.04710,
  title  = {Empowering the Fact-checkers! Automatic Identification of Claim Spans on Twitter},
  author = {Megha Sundriyal and Atharva Kulkarni and Vaibhav Pulastya and Md Shad Akhtar and Tanmoy Chakraborty},
  journal= {arXiv preprint arXiv:2210.04710},
  year   = {2022}
}

备注

Accepted at EMNLP22. 16 pages including Appendix