中文

HRDE:面向中文健康谣言检测与可解释性的检索增强大语言模型

计算与语言 2024-07-04 v2

摘要

随着人们对健康的关注度不断提升,互联网上健康信息的传播速度和覆盖范围也随之增长。然而,真实内容中掺杂着虚假健康信息(健康谣言)的现象引发了对公共卫生的重大潜在威胁。当前关于中文健康谣言的研究仍缺乏大规模、公开且开源的健康谣言信息数据集,以及有效且可靠的谣言检测方法。本文通过网页抓取常见健康相关问题并进行一系列数据处理步骤,构建包含112万条健康相关谣言的数据集(HealthRCN)。HealthRCN 是目前已知规模最大的中文健康信息谣言数据集。基于该数据集,我们提出了用于中文健康谣言检测与可解释性的检索增强大语言模型(HRDE)。该模型利用检索到的相关信息,准确判断输入的健康信息是否为谣言,并提供解释性回答,有效辅助用户验证健康信息的真实性。在评估实验中,我们比较了多种模型,发现 HRDE 在谣言检测准确率和答案质量方面均优于其他模型,包括 GPT-4-1106-Preview。HRDE 实现的平均准确率为 91.04%,F1 分数为 91.58%。

关键词

引用

@article{arxiv.2407.00668,
  title  = {HRDE: Retrieval-Augmented Large Language Models for Chinese Health Rumor Detection and Explainability},
  author = {Yanfang Chen and Ding Chen and Shichao Song and Simin Niu and Hanyu Wang and Zeyun Tang and Feiyu Xiong and Zhiyu Li},
  journal= {arXiv preprint arXiv:2407.00668},
  year   = {2024}
}