中文

When retrieval outperforms generation: Dense evidence retrieval for scalable fake news detection

计算与语言 2025-11-10 v1

摘要

虚假信息的扩散 necessitates robust yet computationally efficient fact verification systems。虽然当前SOTA方法利用大型语言模型(LLM)生成解释性论据,但这些方法在实际部署中面临显著的计算障碍和幻觉风险。我们提出DeReC(Dense Retrieval Classification),一种轻量级框架,展示了通用文本嵌入如何有效地取代基于自回归LLM的方法在事实核查任务中。通过将稠密检索与专用分类结合,我们的系统在准确性上优于现有方法,同时显著更高效。DeReC在效率上优于生成解释性LLM,RAWFC数据集上运行时间降低95%(从454分钟12秒降至23分钟36秒),LIAR-RAW数据集上降低92%(从1692分钟23秒降至134分钟14秒),展示了其在不同数据集规模下的有效性。在RAWFC数据集上,DeReC实现了65.58%的F1分数,超越了SOTA方法L-Defense的61.20%。我们的结果表明,精心设计的检索基系统在特定任务中可以匹配或超越LLM性能,同时在实际部署中更为实用。

关键词

引用

@article{arxiv.2511.04643,
  title  = {When retrieval outperforms generation: Dense evidence retrieval for scalable fake news detection},
  author = {Alamgir Munir Qazi and John P. McCrae and Jamal Abdul Nasir},
  journal= {arXiv preprint arXiv:2511.04643},
  year   = {2025}
}