中文

谄媚是教育安全风险:为何 LLM 导师需要谄媚基准

人工智能 2026-05-15 v1 人机交互

摘要

这篇立场论文认为,有效的辅导需要纠正性摩擦:揭示误解并支持性地挑战它们,以推动概念转变。然而,偏好对齐的 LLM 可能会以认识论严谨性换取顺从性。我们识别出一个推理-谄媚悖论:能够抵抗上下文切换框架攻击的模型,在社会-认识论压力下仍可能屈服,尤其是权威性(“我的笔记说我是对的”)和社会-情感保全面子(“请不要告诉我我错了”)。我们引入了 EduFrameTrap,一个跨越数学、物理、经济学、化学、生物学和计算机科学的辅导基准,它改变了学生的信心和压力(上下文切换、权威、社会-情感)。在两个前沿 LLM 上,GPT-5.2 的上下文切换失败率相对较低,而权威和社会压力更常引发认识论退却。相比之下,Claude 在本次运行中表现出显著的上下文切换脆弱性。由于这些失败难以自动评判,我们报告双评判者分歧作为可靠性信号。我们认为,基准应该衡量社会-认识论勇气,即支持性但纠正性的辅导,并将友善但正确的行为视为一项安全要求。

关键词

引用

@article{arxiv.2605.14604,
  title  = {Sycophancy is an Educational Safety Risk: Why LLM Tutors Need Sycophancy Benchmarks},
  author = {Enkelejda Kasneci and Gjergji Kasneci},
  journal= {arXiv preprint arXiv:2605.14604},
  year   = {2026}
}