中文

LTCR:长文本中文谣言检测数据集

计算与语言 2023-06-14 v2

摘要

虚假信息能在社交媒体上快速传播,负面影响到公民对社会事件的行为与回应。为更好检测所有假新闻,尤其是更难被完整发现的長文本,我们提出一个名为 LTCR 的长文本中文谣言检测数据集。LTCR 数据集为准确检测错误信息提供了宝贵资源,尤其在涉及 COVID-19 的复杂假新闻背景下。该数据集由 1,729 条真实新闻与 500 条虚假新闻组成。真实与虚假新闻的平均长度分别约为 230 与 152 字符。我们还提出 \method,显著性感知假新闻检测模型,其在数据集上取得了最高准确率(95.85%)、假新闻召回率(90.91%)与 F 值(90.60%)。(https://github.com/Enderfga/DoubleCheck)

关键词

引用

@article{arxiv.2306.07201,
  title  = {LTCR: Long-Text Chinese Rumor Detection Dataset},
  author = {Ziyang Ma and Mengsha Liu and Guian Fang and Ying Shen},
  journal= {arXiv preprint arXiv:2306.07201},
  year   = {2023}
}