中文

与更具说服力的 LLM 辩论可得出更真实的答案

人工智能 2024-07-29 v4 计算与语言

摘要

将大型语言模型(LLM)与期望行为对齐的常用方法严重依赖人工标注数据。然而,随着模型变得越来越复杂,它们将超越人类专业知识,人类评估的角色将演变为非专家监督专家。鉴于此,我们提出疑问:较弱的模型能否评估较强模型的正确性?我们在一个类比场景中调查了这个问题,其中较强的模型(专家)拥有回答问题所需的信息,而较弱的模型(非专家)缺乏这些信息。我们评估的方法是辩论,即两个 LLM 专家分别为不同的答案辩护,由非专家选择答案。我们发现,辩论始终有助于非专家模型和人类回答问题,准确率分别达到 76% 和 88%(朴素基线分别为 48% 和 60%)。此外,以无监督方式优化专家辩论者的说服力,提高了非专家在辩论中识别真相的能力。我们的结果提供了令人鼓舞的经验证据,证明在缺乏地面真实值的情况下,利用辩论对齐模型的可行性。

关键词

引用

@article{arxiv.2402.06782,
  title  = {Debating with More Persuasive LLMs Leads to More Truthful Answers},
  author = {Akbir Khan and John Hughes and Dan Valentine and Laura Ruis and Kshitij Sachan and Ansh Radhakrishnan and Edward Grefenstette and Samuel R. Bowman and Tim Rocktäschel and Ethan Perez},
  journal= {arXiv preprint arXiv:2402.06782},
  year   = {2024}
}

备注

For code please check: https://github.com/ucl-dark/llm_debate