中文

LLM 辩论中的演绎动力学与价值对齐

人工智能 2026-03-10 v2

摘要

随着大语言模型(LLM)在提供个人建议、心理健康支持和道德指导等敏感日常场景中的部署增加,理解其在复杂道德推理中行为变得至关重要。大多数评估通过单轮提示词进行社会技术对齐评估,但尚不清楚这些发现是否延续至多轮设置,亦不清楚这些发现如何取决于用于协调代理系统的交互协议。我们利用 LLM 辩论研究在多轮设置中对演绎动力学和价值对齐进行考察,通过提示三个模型子集(GPT-4.1、Claude 3.7 Sonnet 和 Gemini 2.0 Flash)在来自 Reddit "Am I the Asshole" 社区的 1000 个日常困境中共同分配责任。为测试顺序效应并评估 verdict 修订情况,我们采用同步(平行响应)和轮流(顺序响应)两种辩论结构,模拟多代理系统在实际应用中的编排方式。我们的发现显示出显著的行为差异。在同步设置下,GPT-4.1 显示出强烈惯性(0.6-3.1% 修订率),而Claude 3.7 Sonnet 和 Gemini 2.0 Flash 灵活性更强(28-41% 修订率)。价值模式也呈现差异:GPT-4.1 强调个人自主性和直接沟通(相对于其辩论伙伴),而Claude 3.7 Sonnet 和 Gemini 2.0 Flash 优先考虑同理心对话。我们进一步发现,辩论格式对模型行为影响显著:GPT-4.1 和 Gemini 2.0 Flash 表现为高度顺从,其 verdict 行为受顺序效应强烈影响,而Claude 3.7 Sonnet 则相对独立。我们提供了针对开源模型(DeepSeek-V3.2 和 Llama 3.1)的额外结果。

关键词

引用

@article{arxiv.2510.10002,
  title  = {Deliberative Dynamics and Value Alignment in LLM Debates},
  author = {Pratik S. Sachdeva and Tom van Nuenen},
  journal= {arXiv preprint arXiv:2510.10002},
  year   = {2026}
}