过于礼貌而不敢反对:理解多智能体系统中的谄媚传播
计算与语言
2026-04-06 v1 人工智能
多智能体系统
摘要
大语言模型(LLMs)常表现出谄媚倾向:即使与模型自身观点相冲突,仍同意用户立场。虽然先前工作大多在单智能体设置中研究此问题,但在协作式多智能体系统中仍未被充分探索。我们提出问题:智能体对其他智能体谄媚程度的认知是否会影响讨论结果。为研究此问题,我们对六种开源大语言模型进行了受控实验,向智能体提供基于各种静态(讨论前)和动态(在线)策略计算的同伴谄媚度排名。我们发现,提供谄媚先验减少了谄媚倾向强的同伴的影响,缓解了错误级联,并将最终讨论准确率绝对提升了 10.5%。因此,这是一种轻量且有效的方法,可减少讨论中的谄媚并提升下游准确率。
引用
@article{arxiv.2604.02668,
title = {Too Polite to Disagree: Understanding Sycophancy Propagation in Multi-Agent Systems},
author = {Vira Kasprova and Amruta Parulekar and Abdulrahman AlRabah and Krishna Agaram and Ritwik Garg and Sagar Jha and Nimet Beyza Bozdag and Dilek Hakkani-Tur},
journal= {arXiv preprint arXiv:2604.02668},
year = {2026}
}