单一 LLM 辩论,MoLaCE:混合潜在概念专家抗确认偏差
计算与语言
2025-12-30 v1
摘要
大型语言模型 (LLM) 对输入确认偏差极易受到影响。当提示暗示首选答案时,模型往往会强化该偏差而非探索备选方案。尽管这一现象尚未得到充分探讨,但它已在基础模型中造成问题,并在多智能体辩论中形成更大的风险——共鸣腔不断强化偏见,导致无法纠正。我们引入混合潜在概念专家 (Mixture of Latent Concept Experts, MoLaCE),这是一种轻量级的推理时框架,通过混合不同激活强度的专家来解决确认偏差。我们的关键洞见是:由于语言的组成性,不同措辞的提示以特定方式重新加权潜在概念,这些概念影响事实正确性,因此不可能对所有输入统一应用单一固定干预。这种设计使单一 LLM 能够在保持计算效率和可扩展性的同时,内部模拟多智能体辩论的效益。它还可以集成到多智能体辩论框架中,以多样化视角和减少相关错误。我们通过实证研究表明,该方法能持续降低确认偏差,提高鲁棒性,并在仅用少量计算资源的情况下匹配或超越多智能体辩论。
引用
@article{arxiv.2512.23518,
title = {Single LLM Debate, MoLaCE: Mixture of Latent Concept Experts Against Confirmation Bias},
author = {Hazel Kim and Philip Torr},
journal= {arXiv preprint arXiv:2512.23518},
year = {2025}
}