辩论有助于监督不可靠专家
人工智能
2023-11-16 v1 计算与语言
摘要
随着 AI 系统被用于回答更困难的问题并可能帮助创造新知识,判断其输出的真实性变得愈发困难且重要。当监督者无法自行区分两者时,我们如何监督那些能接触真相但可能不准确报告的不可靠专家,使其给出系统性真实而非仅表面看似真实的答案?在这项工作中,我们表明,两个不可靠专家之间的辩论可以帮助非专家判断者更可靠地识别真相。我们收集了一个由人类撰写的辩论数据集,主题为难阅读理解问题,其中判断者未阅读源段落,仅看到由可接触段落的“专家”辩手有选择地揭示的专家论证与简短引文。在我们的辩论中,一名专家为正确答案辩护,另一名为错误答案辩护。将辩论与一种称为咨询的基线比较(在咨询中,单一专家仅为一半正确的一个答案辩护),我们发现辩论表现显著更优,判断者准确率为 84%,而咨询为 74%。辩论也更高效,长度为咨询的 68%。通过比较人类与 AI 辩手,我们发现证据表明,随着辩手技巧更高(此处指人类),辩论表现上升而咨询表现下降。我们的误差分析也支持这一趋势:人类辩论中 46% 的错误可归因于诚实辩手的失误(随技巧提高应消失);而人类咨询中 52% 的错误源于辩手向判断者隐瞒相关证据(随技巧提高应更严重)。总体而言,这些结果表明辩论是监督能力日益增强但可能不可靠的 AI 系统的一个有前景的方法。
引用
@article{arxiv.2311.08702,
title = {Debate Helps Supervise Unreliable Experts},
author = {Julian Michael and Salsabila Mahdi and David Rein and Jackson Petty and Julien Dirani and Vishakh Padmakumar and Samuel R. Bowman},
journal= {arXiv preprint arXiv:2311.08702},
year = {2023}
}
备注
84 pages, 13 footnotes, 5 figures, 4 tables, 28 debate transcripts; data and code at https://github.com/julianmichael/debate/tree/2023-nyu-experiments