中文

评估生成式智能体在众包事实核查中的潜力

计算与语言 2025-10-28 v2 人工智能 多智能体系统

摘要

在线虚假信息的传播不断扩大,迫切需要可扩展且可靠的事实核查解决方案。众包事实核查——即由非专家评估主张的真伪——作为专家验证的替代方案,具有成本效益高的优势,尽管存在质量参差不齐和偏见等方面的担忧。鼓励此类方法在特定情境下的令人鼓舞的结果,主流平台如 X(前身为 Twitter)、Facebook 和 Instagram 已开始从集中化监管转向去中心化、基于众包的方法。与此同时,大型语言模型(LLM)在核心事实核查任务中表现出色,包括主张检测和证据评估。然而,它们在众包工作流程中的潜在作用尚未被探索。本文研究了生成式智能体——即模拟人类行为与决策的自主实体——是否能够在传统上由人类众包完成的事实核查任务中发挥有意义的贡献。我们采用 La Barbera 等人 (2024) 的协议,模拟具有不同人口统计特征和意识形态 profile 的生成式智能体群体。这些智能体检索证据、沿多个质量维度评估主张,并发布最终的真伪判断。我们的结果表明,智能体群体在真实性分类方面优于人类群体,表现出更高的内部一致性,同时对社交和认知偏见的易受性更低。与人类相比,智能体更系统地依赖诸如准确性、精确性和信息性等有价值标准,这表明其决策过程更为结构化。总体而言,我们的发现凸显了生成式智能体作为可扩展、一致且偏见更少的众包事实核查系统贡献者的潜力。

关键词

引用

@article{arxiv.2504.19940,
  title  = {Assessing the Potential of Generative Agents in Crowdsourced Fact-Checking},
  author = {Luigia Costabile and Gian Marco Orlando and Valerio La Gatta and Vincenzo Moscato},
  journal= {arXiv preprint arXiv:2504.19940},
  year   = {2025}
}

备注

This paper has been published in Online Social Networks and Media (https://doi.org/10.1016/j.osnem.2025.100326). Please cite the published version accordingly