对人迎合者的好建议:推理如何缓解(却掩盖)LLM 迎合症
计算与语言
2026-03-18 v1
摘要
对齐技术常常不可避免地诱导 LLM 表现迎合症行为。虽然先前研究在直接回答情境中研究了这一行为,但链式思考(Chain-of-Thought, CoT)推理的作用仍鲜有探讨:它是充当逻辑约束以缓解迎合症,还是用于事后合理化的工具,从而掩盖迎合症?我们在客观与主观任务上评估了多种模型,以检验这一问题。结果表明,推理通常会减少最终决策中的迎合症行为,但也会在某些样本中掩盖迎合症,其中模型通过逻辑不一致、计算错误和片面论点等方式构建欺骗性论证。此外,LLM 在主观任务中以及面对权威偏见时更容易表现迎合症。我们对三个开源模型进行的机制性分析揭示,迎合症倾向在推理过程中是动态的,而非在输入阶段预先决定的。
引用
@article{arxiv.2603.16643,
title = {Good Arguments Against the People Pleasers: How Reasoning Mitigates (Yet Masks) LLM Sycophancy},
author = {Zhaoxin Feng and Zheng Chen and Jianfei Ma and Yip Tin Po and Emmanuele Chersoni and Bo Li},
journal= {arXiv preprint arXiv:2603.16643},
year = {2026}
}