在多轮对话中衡量语言模型的谄媚性
计算与语言
2026-03-02 v4
摘要
大语言模型(LLM)被期望提供有用且无害的回复,但它们经常表现出谄媚性——即无论事实准确性或道德合理性如何,都顺从用户的信念。先前关于谄媚性的研究主要集中在单轮事实正确性上,忽略了现实世界交互的动态性。在本工作中,我们引入了 SYCON Bench,这是一个用于在多轮、自由形式的对话设置中评估谄媚行为的新颖基准。我们的基准衡量了模型顺从用户的速度(Turn of Flip)以及在持续的用户压力下改变立场的频率(Number of Flip)。将 SYCON Bench 应用于三个现实世界场景中的 17 个 LLM,我们发现谄媚仍然是一种普遍的失败模式。我们的分析表明,对齐微调会放大谄媚行为,而模型规模扩展和推理优化则增强了模型抵制不良用户观点的能力。推理模型通常优于指令微调模型,但当它们过度侧重于逻辑阐述而不是直接解决用户的潜在信念时,往往会失败。最后,我们评估了四种额外的提示策略,并证明在辩论场景中采用第三人称视角可将谄媚性降低高达 63.8%。我们在 https://github.com/JiseungHong/SYCON-Bench 发布了我们的代码和数据。
引用
@article{arxiv.2505.23840,
title = {Measuring Sycophancy of Language Models in Multi-turn Dialogues},
author = {Jiseung Hong and Grace Byun and Seungone Kim and Kai Shu and Jinho D. Choi},
journal= {arXiv preprint arXiv:2505.23840},
year = {2026}
}
备注
Accepted to Findings of EMNLP 2025