中文

AI 辩手在与自身信念一致时更具说服力

计算与语言 2025-11-25 v3 人工智能

摘要

AI 辩论作为可扩展监督技术的核心前提是,说谎比驳斥谎言更难令人信服,从而使评委能够识别出正确立场。然而,现有辩论实验依赖具有确定真值的数据集,其中说谎被简化为捍卫错误命题。这忽略了一个主观维度:说谎还需要相信所捍卫的主张是错误的。在本工作中,我们将辩论应用于主观问题并显式测量大型语言模型的先前信念。辩手被要求选择其偏好立场,然后面对一个刻意设计与其先前信念相冲突的评委角色。这一设置测试了模型是否会采用亲和策略,即与评委假定的视角一致以最大化说服力,或保持忠于其先前信念。我们实现并比较了两种辩论协议,顺序式和同时式,以评估潜在的系统性偏差。最后,我们评估了在捍卫与其先前信念一致的立场时,模型是否更具说服力且产生更高质量的论点。我们的主要发现表明,模型倾向于选择捍卫与评委角色相符的立场而非其先前信念、顺序式辩论对第二位辩手引入显著偏差、在捍卫与其先前信念一致的立场时模型更具说服力,以及与先前信念不一致的论点在两两比较中被评定为更高质量。这一结果可以为人类评委提供更高质量的训练信号,促进更对齐的 AI 系统,同时揭示了关于人类与 AI 交互中说服动态的重要方面。

关键词

引用

@article{arxiv.2510.13912,
  title  = {AI Debaters are More Persuasive when Arguing in Alignment with Their Own Beliefs},
  author = {María Victoria Carro and Denise Alejandra Mester and Facundo Nieto and Oscar Agustín Stanchi and Guido Ernesto Bergman and Mario Alejandro Leiva and Eitan Sprejer and Luca Nicolás Forziati Gangi and Francisca Gauna Selasco and Juan Gustavo Corvalán and Gerardo I. Simari and María Vanina Martinez},
  journal= {arXiv preprint arXiv:2510.13912},
  year   = {2025}
}

备注

31 pages