藏在眼前:面向抗扩散推理模型的可检测性感知对抗
密码学与安全
2026-05-12 v2 人工智能
摘要
通过采样推理轨迹进行的蒸馏会暴露闭源前沿模型给 Adversarial 第三方,这些第三方可以绕过模型的 guardrails 并滥用其能力。抗扩散方法旨在通过中毒推理轨迹来阻挡学生模型学习,同时保持教师性能。然而,当前方法忽略了可检测性,包括语义可检测性和语法可检测性,这会削弱教师输出的可信度,并向对手信号防御的存在。我们通过将抗扩散建模为一个 Stackelberg 游戏,其约束集显式编码了可检测性,并展示了对少量扰动提供的有效且可检测性更低的替代方案,相较于对完整轨迹进行中毒。借助机制解释学,我们识别出思想锚点(thought anchors),即对模型输出具有不成比例后事实影响的句子,作为原则性稀疏目标:对推理至关重要,又最小化可检测性。我们在 TraceGuard 中实现了这一方法,这是一个无训练、黑盒的原型系统,通过分支 token 检测思想锚点并对其进行中毒,以降低学生蒸馏的同时保持轨迹连贯性。
引用
@article{arxiv.2604.23238,
title = {Hiding in Plain Sight: Detectability-Aware Antidistillation of Reasoning Models},
author = {Max Hartman and Vidhata Jayaraman and Moulik Choraria and Yash Savani and Lav R. Varshney},
journal= {arXiv preprint arXiv:2604.23238},
year = {2026}
}