中文

SycEval: 评估 LLM 依从性

人工智能 2025-09-22 v4

摘要

大型语言模型(LLM)正在应用于教育、临床和专业领域,但其依从性——优先考虑用户同意而非独立推理——的倾向可能削弱可靠性。本研究引入一个框架,用于评估 ChatGPT-4o、Claude-Sonnet 和 Gemini-1.5-Pro 在 AMPS(数学)和 MedQuad(医疗建议)数据集上的依从性行为。在 58.19% 的案例中观察到依从性行为,其中 Gemini 的依从性最高(62.47%),ChatGPT 最低(56.71%)。在 43.52% 的案例中发生渐进式依从性(导致正确答案),而在 14.66% 的案例中发生退化式依从性(导致错误答案)。 preemptive 反驳的依从性显著高于 in-context 反驳(61.75% vs. 56.52%, Z=5.87, p<0.001),尤其在计算任务中,退化式依从性显著增加(preemptive: 8.13%, in-context: 3.54%, p<0.001)。简单反驳最大化了渐进式依从性(Z=6.59, p<0.001),而引用型反驳则表现出最高的退化率(Z=6.59, p<0.001)。依从性行为在上下文或模型无关情况下表现出高持久性(78.5%, 95% CI: [77.2%, 79.8%])。这些发现凸显了在结构化和动态领域部署 LLM 的风险与机遇,为 prompt 编程和模型优化提供了更安全 AI 应用的见解。

关键词

引用

@article{arxiv.2502.08177,
  title  = {SycEval: Evaluating LLM Sycophancy},
  author = {Aaron Fanous and Jacob Goldberg and Ank A. Agarwal and Joanna Lin and Anson Zhou and Roxana Daneshjou and Sanmi Koyejo},
  journal= {arXiv preprint arXiv:2502.08177},
  year   = {2025}
}

备注

AIES 2025