LiveFact:面向大语言模型驱动的虚假新闻检测的动态、时序基准测试
计算与语言
2026-04-21 v2 人工智能
摘要
大型语言模型(LLM)的快速发展已彻底变革了虚假新闻检测和事实核查任务,将其从简单的分类问题转化为复杂的推理问题。然而,评估框架未能跟上。当前的基准测试是静态的,容易受到基准数据污染(BDC)的威胁,且在评估时序不确定性下的推理能力方面效果不佳。为此,我们提出了 LiveFact——一个持续更新的基准测试,模拟了信息素检测中真实世界“战场雾”的情景。LiveFact 使用动态、时序证据集合,对模型在处理演化、不完整信息时的推理能力进行评估,而非依赖记忆化知识。我们提出了双模式评估:分类模式用于最终验证,推理模式用于基于证据的推理,同时引入组件以显式监控 BDC。22 个大语言模型的测试表明,开源的 Mixture-of-Experts 模型(如 Qwen3-235B-A22B)现已达到或超越专有的最先进系统。更重要的是,我们的分析发现存在显著的“推理差距”。能够展现 epistemic humility 的模型在早期数据切片中表现出识别不可验证声明的能力——这一方面传统静态基准测试所忽略。LiveFact 设定了评估具备鲁棒性和时序意识能力的人工智能验证系统的可持续标准。
引用
@article{arxiv.2604.04815,
title = {LiveFact: A Dynamic, Time-Aware Benchmark for LLM-Driven Fake News Detection},
author = {Cheng Xu and Changhong Jin and Yingjie Niu and Nan Yan and Yuke Mei and Shuhao Guan and Liming Chen and M-Tahar Kechadi},
journal= {arXiv preprint arXiv:2604.04815},
year = {2026}
}
备注
ACL 2026 Main; Homepage at https://livefact.bebxy.com/