中文

从负例中学习:为何警告框架的训练数据会教会模型其所警告的行为

机器学习 2025-12-30 v1 计算与语言 密码学与安全

摘要

训练数据中的警告框架内容(例如,“请勿使用——此代码存在漏洞”)实际上并不会教会语言模型避免被警告的行为。在本文报告的实验中,接触此类警告的模型复现被标记内容的比率,与直接接触该内容的模型在统计上无法区分(76.7% 对比 83.3%)。原因何在?稀疏自编码器分析指向了正交化的失败:“描述X”和“执行X”激活了重叠的潜在特征。跟踪代码执行模式的特征#8684,在警告和利用两种语境下均以相当的强度被激活。一个我称之为“隐形滑移”的相关现象,允许对话式引导将激活旋转到线性探针完全无法捕捉的子空间中。提示和推理时引导无法解决此问题;训练时的特征消融则可以。其结论是,在当前架构中,统计共现压倒了语用解释。模型学习的是某个语境下倾向于出现什么,而非它为何出现在那里。

关键词

引用

@article{arxiv.2512.22293,
  title  = {Learning from Negative Examples: Why Warning-Framed Training Data Teaches What It Warns Against},
  author = {Tsogt-Ochir Enkhbayar},
  journal= {arXiv preprint arXiv:2512.22293},
  year   = {2025}
}

备注

Submitted to Neel Nanda's MATS Stream