AI 辩论辅助评估争议性主张
计算与语言
2025-10-31 v2
摘要
随着 AI 变得越来越强大,它将日益影响我们理解世界的方式。但这种影响力也带来了放大错误信息和加深社会分歧的风险——尤其是在事实准确性直接影响人们福祉的重大议题上。可扩展监督旨在确保 AI 系统即使在其能力超过评估者时仍保持真实性。然而,当人类作为评估者时,他们自身的信念和偏见可能会损害判断。我们研究 AI 辩论是否能够引导有偏见的评判者走向真相,方法是让两个 AI 系统就人们持有强烈先验信念的 COVID-19 和气候变化等争议性事实主张的对立面进行辩论。我们进行了两项研究。研究 I 招募了具有主流或怀疑信念的人类评判者,他们通过两种协议评估主张:辩论(与两个对立辩论的 AI 顾问交互)或咨询(与单个 AI 顾问交互)。研究 II 使用带有人类角色和不带角色的 AI 评判者来评估相同的协议。在研究 I 中,辩论持续提高了人类判断的准确性和置信度校准,在 COVID-19 和气候变化主张上比咨询高出 4-10%。对于持有主流信念的评判者,这种提升最为显著(在 COVID-19 主张上准确率提高达 15.2%),尽管辩论也有助于最初误判主张的怀疑论评判者转向准确观点(准确率提高 4.7%)。在研究 II 中,具有人类角色的 AI 评判者达到了比人类评判者(70.1%)和无角色的默认 AI 评判者(69.8%)更高的准确率(78.5%),表明它们在监督前沿 AI 模型方面的潜力。这些发现突显了 AI 辩论作为争议领域中可扩展、抗偏见监督的有前景的途径。
引用
@article{arxiv.2506.02175,
title = {AI Debate Aids Assessment of Controversial Claims},
author = {Salman Rahman and Sheriff Issaka and Ashima Suvarna and Genglin Liu and James Shiffer and Jaeyoung Lee and Md Rizwan Parvez and Hamid Palangi and Shi Feng and Nanyun Peng and Yejin Choi and Julian Michael and Liwei Jiang and Saadia Gabriel},
journal= {arXiv preprint arXiv:2506.02175},
year = {2025}
}