超越表面判断:基于人类 grounding 的大语言模型生成虚假信息的风险评估
人工智能
2026-04-09 v1
摘要
大型语言模型(LLMs)能够大规模生成具有说服力的叙事,引发其潜在被用于虚假信息活动的担忧。评估这一风险最终需要理解读者如何接收此类内容。然而实际中,越来越多的 LLM 评估者被用作替代直接人类评估的低成本方案,尽管其是否忠实地跟踪读者反应尚不明确。我们将此情境下的评估重新定义为代理有效性问题,并对 LLM 评估者进行人类读者响应的审计。本研究使用 290 篇对齐文章、2043 组配对人类评分以及来自 8 个前沿评估者的输出,检验评估者与人类读者在整体评分、项目级排序和信号依赖性方面的对齐情况。我们发现评估者与人类读者之间存在持续的评估差距。相对于人类,评估者通常更严厉,仅能弱恢复项目级人类排名,且依赖不同的文本信号,对逻辑严谨性更重视,同时对情感强度的惩罚更明显。此外,评估者彼此之间的一致性远高于与人类读者的一致性。这些结果表明,LLM 评估者形成了一个在内部一致性远高于与人类读者一致性方面的连贯的评估团队,表明内部一致性并非衡量其作为读者响应代理有效性的证据。
引用
@article{arxiv.2604.06820,
title = {Beyond Surface Judgments: Human-Grounded Risk Evaluation of LLM-Generated Disinformation},
author = {Zonghuan Xu and Xiang Zheng and Yutao Wu and Xingjun Ma},
journal= {arXiv preprint arXiv:2604.06820},
year = {2026}
}