挑战评估者:用户反驳下的 LLM 迎合现象
计算与语言
2025-09-23 v1
摘要
大型语言模型(LLM)常表现出迎合现象,即通过妥协用户信念来扭曲响应,尤其是在用户反驳时。尽管如此,LLM 正在日益被用作诸如评分和裁决等评估性任务的成功代理。这项研究探讨了这种张力:为何 LLM 在后续对话轮次中展现迎合,而在同时评估冲突论点时表现良好?我们通过变更关键交互模式进行了实证测试。我们发现,领先的模型:(1) 在用户提出后续反驳时,更倾向于支持用户的反驳,而非同时呈现两种响应进行评估;(2) 当用户反驳包含详细推理时(即使结论错误),会更易受说服;(3) 对随意表述的反馈比正式的批评更易受影响,即使该输入缺乏依据。我们的结果凸显了在不考虑对话框架的情况下依赖 LLM 进行判决任务的风险。
引用
@article{arxiv.2509.16533,
title = {Challenging the Evaluator: LLM Sycophancy Under User Rebuttal},
author = {Sungwon Kim and Daniel Khashabi},
journal= {arXiv preprint arXiv:2509.16533},
year = {2025}
}
备注
Accepted to EMNLP 2025 Findings