LTCR:长文本中文谣言检测数据集
计算与语言
2023-06-14 v2
摘要
虚假信息能在社交媒体上快速传播,负面影响到公民对社会事件的行为与回应。为更好检测所有假新闻,尤其是更难被完整发现的長文本,我们提出一个名为 LTCR 的长文本中文谣言检测数据集。LTCR 数据集为准确检测错误信息提供了宝贵资源,尤其在涉及 COVID-19 的复杂假新闻背景下。该数据集由 1,729 条真实新闻与 500 条虚假新闻组成。真实与虚假新闻的平均长度分别约为 230 与 152 字符。我们还提出 \method,显著性感知假新闻检测模型,其在数据集上取得了最高准确率(95.85%)、假新闻召回率(90.91%)与 F 值(90.60%)。(https://github.com/Enderfga/DoubleCheck)
引用
@article{arxiv.2306.07201,
title = {LTCR: Long-Text Chinese Rumor Detection Dataset},
author = {Ziyang Ma and Mengsha Liu and Guian Fang and Ying Shen},
journal= {arXiv preprint arXiv:2306.07201},
year = {2023}
}