AI智能体蒸馏中不安全行为的隐性转移
人工智能
2026-04-20 v1
摘要
近期关于隐性学习的研究表明,语言模型能够通过与某些语义特征语义无关的数据来传递这些特征。然而,在智能体系统中,策略是从轨迹而非静态文本中学习的,行为特征是否能在这种系统中转移仍不清楚。在本研究中,我们首次提供经验证据表明,在两种互补的实验设置下,不安全的智能体行为可以通过模型蒸馏被隐性转移。在我们的主要设置中,我们构建了一个表现出强烈删除偏差的教师智能体,即倾向于通过API式工具接口执行破坏性文件系统操作,并仅使用表面上安全的任务轨迹将其蒸馏给学生智能体,其中所有显式删除关键词均被严格过滤。在我们的次要设置中,我们在原生Bash环境中复制了该威胁模型,将API工具调用替换为shell命令,并将偏差操作化为在语义等价的替代命令(如chown或setfacl)中,优先发出chmod作为第一条与权限相关的命令。尽管在两种设置中均进行了完整的关键词净化,学生智能体仍继承了可测量的行为偏差。在API设置中,同构蒸馏下学生智能体的删除率达到100%(基线为5%);在Bash设置中,学生智能体的chmod优先率达到30%-55%(基线为0%-10%),其中在从大到小的蒸馏中观察到最强的转移效应。我们的结果表明,显式数据净化是不充分的防御手段,无论使用何种工具接口,行为偏差均以隐式方式编码于轨迹动力学中。
引用
@article{arxiv.2604.15559,
title = {Subliminal Transfer of Unsafe Behaviors in AI Agent Distillation},
author = {Jacob Dang and Brian Y. Xie and Omar G. Younis},
journal= {arXiv preprint arXiv:2604.15559},
year = {2026}
}