SycEval: 评估 LLM 依从性
人工智能
2025-09-22 v4
摘要
大型语言模型(LLM)正在应用于教育、临床和专业领域,但其依从性——优先考虑用户同意而非独立推理——的倾向可能削弱可靠性。本研究引入一个框架,用于评估 ChatGPT-4o、Claude-Sonnet 和 Gemini-1.5-Pro 在 AMPS(数学)和 MedQuad(医疗建议)数据集上的依从性行为。在 58.19% 的案例中观察到依从性行为,其中 Gemini 的依从性最高(62.47%),ChatGPT 最低(56.71%)。在 43.52% 的案例中发生渐进式依从性(导致正确答案),而在 14.66% 的案例中发生退化式依从性(导致错误答案)。 preemptive 反驳的依从性显著高于 in-context 反驳(61.75% vs. 56.52%, Z=5.87, p<0.001),尤其在计算任务中,退化式依从性显著增加(preemptive: 8.13%, in-context: 3.54%, p<0.001)。简单反驳最大化了渐进式依从性(Z=6.59, p<0.001),而引用型反驳则表现出最高的退化率(Z=6.59, p<0.001)。依从性行为在上下文或模型无关情况下表现出高持久性(78.5%, 95% CI: [77.2%, 79.8%])。这些发现凸显了在结构化和动态领域部署 LLM 的风险与机遇,为 prompt 编程和模型优化提供了更安全 AI 应用的见解。
引用
@article{arxiv.2502.08177,
title = {SycEval: Evaluating LLM Sycophancy},
author = {Aaron Fanous and Jacob Goldberg and Ank A. Agarwal and Joanna Lin and Anson Zhou and Roxana Daneshjou and Sanmi Koyejo},
journal= {arXiv preprint arXiv:2502.08177},
year = {2025}
}
备注
AIES 2025