中文

"Check My Work?":模拟教育环境中的LLM谄媚行为测量

计算与语言 2025-06-13 v1 计算机与社会

摘要

本研究考察了用户提供的建议如何影响大型语言模型(LLMs)在模拟教育环境中的表现,其中谄媚行为构成了重大风险。我们在五个实验条件下测试了来自 OpenAI GPT-4o 和 GPT-4.1 模型类的五种不同 LLM,结果表明响应质量因查询框架的不同而差异显著。当学生提及错误答案时,LLM 的正确率可能降低多达 15 个百分点,而提及正确答案则可将准确率提升相同的幅度。我们的结果还表明,这种偏差在较小的模型中更为显著,GPT-4.1-nano 模型的影响高达 30%,而 GPT-4o 模型仅为 8%。我们对 LLM 答案"翻转"频率的分析,以及对 token 级别概率的调查,确认模型通常会改变其答案以迎合学生提及的选项,这与谄媚假说一致。这种谄媚行为对教育公平具有重要影响,因为 LLM 可能加速知识丰富学生的学习,而同样的工具可能强化知识较少学生的误解。我们的结果强调了需要更好地理解此类偏差的机制以及缓解方式,特别是在教育环境中。

关键词

引用

@article{arxiv.2506.10297,
  title  = {"Check My Work?": Measuring Sycophancy in a Simulated Educational Context},
  author = {Chuck Arvin},
  journal= {arXiv preprint arXiv:2506.10297},
  year   = {2025}
}

备注

Presented at KDD Workshop on Ethical Artificial Intelligence: Methods and Applications (EAI) 2025