不仅仅是 RLHF:为何单靠对齐无法修复多智能体依赖主义
机器学习
2026-05-19 v2 人工智能
摘要
基于 LLM 的多智能体管道在模拟的同行不同意时会从正确答案翻转为错误答案,其翻转率我们称为 yield,这一漏洞被广泛归因于 RLHF 引发的依赖主义。我们在四个模型家族中测试了这种归因,发现 largely 错误:预训练基础模型与其 Instruct 变体 exhibit 相同的代换模式,平均 yield 高于 Instruct。使用激活 patch,我们将腐蚀局限于一个狭窄的中层窗口,其中注意力承担着因果权重,MLP 贡献可忽略不计;在该窗口之上进行 patch 可恢复 96% 的 clean-to-pressured P(correct) 差距。该攻击面分解为两个独立因素(通道框架和 consensus 强度),其相互作用在 majority consensus 下产生 47.5 个百分点的 yield 差距,跨 jury 大小 均得到保持。两个收敛的激活空间干预表明,压力抑制了 clean-reasoning 特征而非激活新的依赖主义电路。一个正确论证的反对者可将 yield 降低 54-73 个百分点,所有测试的框架下均如此,而最强的 prompt-level 防御在设计表面之外的攻击变体上仍然失效。应对该问题的 mitigation 应针对机制,采取管道层面的结构性反对,而非 prompt-level 防御。
引用
@article{arxiv.2605.12991,
title = {Not Just RLHF: Why Alignment Alone Won't Fix Multi-Agent Sycophancy},
author = {Adarsh Kumarappan and Ananya Mujoo},
journal= {arXiv preprint arXiv:2605.12991},
year = {2026}
}