中文

对抗学生攻击下 LLM 导师答案泄露鲁棒性评估

密码学与安全 2026-04-22 v1 人工智能

摘要

大型语言模型 (LLM) 越来越多地用于教育领域,但其默认的有帮助性往往与教育原则相冲突。现有工作通过答案泄露——即完整解决方案的披露而非脚手架式支持——来评估教育质量,但通常假设学习者是善意的,未充分探讨导师在学生滥用情况下的鲁棒性。本文研究学生行为具有对抗性且旨�从导师获取正确答案的情形。我们评估了广泛的 LLM 导师模型,包括不同模型家族、教育对齐的模型以及多主体设计,在各种对抗学生攻击情形下。我们采用六组对抗和说服技术适用于教育场景,并用于探测导师极可能透露最终答案的概率。我们使用不同类型的情境对抗学生代理评估答案泄露鲁棒性,发现它们往往未能实施有效攻击。因此,我们引入了一个我们微调以破解 LLM 导师的对抗学生代理,作为评估导师鲁棒性基准的核心。最后,我们提出了简单但有效的防御策略,以减少答案泄露并增强 LLM 导师在对抗情形下的鲁棒性。

关键词

引用

@article{arxiv.2604.18660,
  title  = {Evaluating Answer Leakage Robustness of LLM Tutors against Adversarial Student Attacks},
  author = {Jin Zhao and Marta Knežević and Tanja Käser},
  journal= {arXiv preprint arXiv:2604.18660},
  year   = {2026}
}

备注

ACL 2026