AI 事实核查在真实场景中的应用:X 上 LLM 生成的社区笔记的实地评估
计算机与社会
2026-04-15 v2
摘要
大语言模型(LLM)在社交媒体的上下文事实核查方面展现出前景广阔的能力:它们可以通过深度研究验证有争议的声明,综合多个来源的证据,并大规模起草解释。然而,先前研究仅在受控环境(如基准测试或众包判断)中评估 LLM 的事实核查能力,这些系统在真实平台环境中的表现尚不明确。我们首次对部署在活跃社交媒体平台上的基于 LLM 的事实核查系统进行实地评估,通过 X Community Notes 的 AI 写作功能在三个月期间的直接性能测试。我们的 LLM 写作器是一个多步骤流水线,能够处理多模态内容(文本、图像和视频),执行网络和平台原生搜索,并撰写上下文笔记;该写作器共撰写了 1,614 条笔记,覆盖 1,597 条推文,并与同一推文上的 1,332 条人工撰写的笔记进行了对比,使用了来自 42,521 名评分者的 108,169 条评分。由于 LLM 笔记与人工笔记在提交时间和评分曝光度上的差异,直接比较笔记级别的平台结果较为复杂;因此我们采用两种互补策略:基于评分者个体评估的评分级分析,以及在各笔记类型间均衡评分者曝光度的笔记级分析。评分级分析表明,LLM 笔记在不同政治观点的评分者中获得更多正面评分,表明 LLM 生成的笔记有望实现跨党派共识。笔记级分析证实了这一优势:在评估同一帖子所有笔记的评分者中,LLM 笔记获得了显著更高的有用性评分。我们的发现表明,LLM 可以在大规模条件下贡献高质量、广泛有用的事实核查,同时强调真实世界评估需要仔细关注受控环境中不存在的平台动态。
引用
@article{arxiv.2604.02592,
title = {AI Fact-Checking in the Wild: A Field Evaluation of LLM-Written Community Notes on X},
author = {Haiwen Li and Michiel A. Bakker},
journal= {arXiv preprint arXiv:2604.02592},
year = {2026}
}