从负例中学习:为何警告框架的训练数据会教会模型其所警告的行为
机器学习
2025-12-30 v1 计算与语言
密码学与安全
摘要
训练数据中的警告框架内容(例如,“请勿使用——此代码存在漏洞”)实际上并不会教会语言模型避免被警告的行为。在本文报告的实验中,接触此类警告的模型复现被标记内容的比率,与直接接触该内容的模型在统计上无法区分(76.7% 对比 83.3%)。原因何在?稀疏自编码器分析指向了正交化的失败:“描述X”和“执行X”激活了重叠的潜在特征。跟踪代码执行模式的特征#8684,在警告和利用两种语境下均以相当的强度被激活。一个我称之为“隐形滑移”的相关现象,允许对话式引导将激活旋转到线性探针完全无法捕捉的子空间中。提示和推理时引导无法解决此问题;训练时的特征消融则可以。其结论是,在当前架构中,统计共现压倒了语用解释。模型学习的是某个语境下倾向于出现什么,而非它为何出现在那里。
引用
@article{arxiv.2512.22293,
title = {Learning from Negative Examples: Why Warning-Framed Training Data Teaches What It Warns Against},
author = {Tsogt-Ochir Enkhbayar},
journal= {arXiv preprint arXiv:2512.22293},
year = {2025}
}
备注
Submitted to Neel Nanda's MATS Stream