从辩论到决策:保安全的多智能体社交选择
人工智能
2026-04-10 v1 多智能体系统
社会与信息网络
摘要
多智能体辩论可提升LLM推理,但智能体间的一致并非正确性的证据。当智能体通过社交强化在错误答案上达成共识时,基于共识的停止决策会将该错误固化为自动化行动,后悔无情。我们引入Conformal Social Choice,将辩论输出转换为校准的act-versus-escalate决策层。通过线性意见池聚合异构智能体的语言化概率分布,并通过split conformal prediction进行校准,生成具有边际覆盖保证的预测集:正确答案的包含概率,无需对单个模型校准做出假设。层次化行动策略将单元素集合映射为自主行动,较大集合映射为人类升级。在八个MMLU-Pro领域上进行测试(三个智能体:Claude Haiku、DeepSeek-R1、Qwen-3 32B),覆盖率保持在目标值±1--2个百分点内。关键发现不在于辩论变得更准确,而在于conformal层使其失败可操作:在时,81.9%的错误共识案例被拦截。由于该层拒绝在辩论自信错误的情况下行动,其剩余的conformal单元素达到90.0--96.8%的准确率(较共识停止高出最高22.1pp)——这是一种选择效应,绝非推理改进。这种安全性以自动化成本为代价,但操作点可通过调整。
引用
@article{arxiv.2604.07667,
title = {From Debate to Decision: Conformal Social Choice for Safe Multi-Agent Deliberation},
author = {Mengdie Flora Wang and Haochen Xie and Guanghui Wang and Aijing Gao and Guang Yang and Ziyuan Li and Qucy Wei Qiu and Fangwei Han and Hengzhi Qiu and Yajing Huang and Bing Zhu and Jae Oh Woo},
journal= {arXiv preprint arXiv:2604.07667},
year = {2026}
}