并非总是如此:衡量 LLM 依从性随认识不确定性的函数关系
计算与语言
2026-05-27 v1 人工智能
机器学习
摘要
大型语言模型 (LLM) 被发现会因用户反对意见而放弃初始立场以遵从用户意愿。虽然先前的研究主要将这种行为归因于在人类反馈强化学习期间学到的迎合行为,但我们假设依从性也受模型在推理时认识不确定性的驱动。本文引入 MUSE,一个两阶段评估框架,用于消解驱动 LLM 依从性的机制。具体而言,MUSE 将模型对查询作出回应的认识不确定性映射为其在后续轮次中向用户反对意见妥协的可能性。我们证明,驱动依从性的机制远超迎合行为 alone。具体来说,我们刻画了两种不同因素共同驱动依从性:迎合式依从性——即模型即使对其初始回应绝对有信心,也会与用户反对意见保持一致;不确定性驱动的依从性——即模型依从的可能性随其不确定性增加而增大。此外,我们进行消融研究,表明迎合式依从性和不确定性驱动的依从性都随着 1) LLM 对用户专业能力的感知以及 2) 用户建议的合理性而增长。更广泛地说,MUSE 通过区分由对齐引起的迎合行为和由训练语料库驱动的不确定性,为更有针对性的干预策略提供指导。
引用
@article{arxiv.2605.27288,
title = {It's Not Always Sycophancy: Measuring LLM Conformity as a Function of Epistemic Uncertainty},
author = {Kevin H. Guo and Chao Yan and Avinash Baidya and Katherine Brown and Xiang Gao and Juming Xiong and Zhijun Yin and Bradley A. Malin},
journal= {arXiv preprint arXiv:2605.27288},
year = {2026}
}