对抗学生攻击下 LLM 导师答案泄露鲁棒性评估
密码学与安全
2026-04-22 v1 人工智能
摘要
大型语言模型 (LLM) 越来越多地用于教育领域,但其默认的有帮助性往往与教育原则相冲突。现有工作通过答案泄露——即完整解决方案的披露而非脚手架式支持——来评估教育质量,但通常假设学习者是善意的,未充分探讨导师在学生滥用情况下的鲁棒性。本文研究学生行为具有对抗性且旨�从导师获取正确答案的情形。我们评估了广泛的 LLM 导师模型,包括不同模型家族、教育对齐的模型以及多主体设计,在各种对抗学生攻击情形下。我们采用六组对抗和说服技术适用于教育场景,并用于探测导师极可能透露最终答案的概率。我们使用不同类型的情境对抗学生代理评估答案泄露鲁棒性,发现它们往往未能实施有效攻击。因此,我们引入了一个我们微调以破解 LLM 导师的对抗学生代理,作为评估导师鲁棒性基准的核心。最后,我们提出了简单但有效的防御策略,以减少答案泄露并增强 LLM 导师在对抗情形下的鲁棒性。
引用
@article{arxiv.2604.18660,
title = {Evaluating Answer Leakage Robustness of LLM Tutors against Adversarial Student Attacks},
author = {Jin Zhao and Marta Knežević and Tanja Käser},
journal= {arXiv preprint arXiv:2604.18660},
year = {2026}
}
备注
ACL 2026