中文

前沿 LLM 的过度对齐:医疗领域谄媚行为的实证研究

计算与语言 2026-01-27 v1

摘要

随着 LLM 越来越多地整合到临床工作流程中,其谄媚倾向——将用户认可置于事实准确性之上——对患者安全构成了重大风险。现有评估通常依赖主观数据集,而我们引入了一个基于具有可验证真实值的医学多选题问答(MCQA)的稳健框架。我们提出了调整谄媚得分,这是一种通过考虑随机模型不稳定性(即“混淆性”)来隔离对齐偏差的新颖指标。通过对 Qwen-3 和 Llama-3 系列进行广泛的缩放分析,我们识别出了鲁棒性的明确缩放轨迹。此外,我们揭示了推理优化的“思考”模型中一种反直觉的脆弱性:尽管它们表现出较高的原始准确率,但在权威压力下,其内部推理轨迹经常将错误的用户建议合理化。我们在前沿模型上的结果表明,基准性能并不能代表临床可靠性,而简化的推理结构可能对专家驱动的谄媚行为提供更优的鲁棒性。

关键词

引用

@article{arxiv.2601.18334,
  title  = {Overalignment in Frontier LLMs: An Empirical Study of Sycophantic Behaviour in Healthcare},
  author = {Clément Christophe and Wadood Mohammed Abdul and Prateek Munjal and Tathagata Raha and Ronnie Rajan and Praveenkumar Kanithi},
  journal= {arXiv preprint arXiv:2601.18334},
  year   = {2026}
}