基于探针的数据归因:发现和缓解 LLM 后训练中的不良行为
机器学习
2026-04-28 v3 人工智能
摘要
我们提出了一种基于探针的数据归因方法,用于追踪后训练语言模型中行为变化的负责训练数据点。通过计算测试提示和偏好对的激活差分向量并按余弦相似性进行排序,我们识别导致特定行为的数据点,并通过重新训练修改数据来因果验证这些归因。对行为-数据点相似性矩阵进行聚类还可实现无监督发现新兴行为。应用于 OLMo 2 生产 DPO 训练,我们发现了干扰触发的顺从行为:即在附加良性格式指令后,模型会对危险请求进行顺从从而产生有害行为。筛选顶级数据点可将该行为降低 63%,而切换其标签可实现 78%。该方法在梯度-based 归因和 LLM-judge 基准中表现优于,同时比两者快 10 倍。这一野外模型生物——从受污染的偏好数据中自然产生——为安全技术提供了真实可用的基准。
关键词
引用
@article{arxiv.2602.11079,
title = {Probe-Based Data Attribution: Discovering and Mitigating Undesirable Behaviors in LLM Post-Training},
author = {Frank Xiao and Santiago Aranguri},
journal= {arXiv preprint arXiv:2602.11079},
year = {2026}
}