D-STEER——偏好对齐技术学会行为而非信念——表面之下,DPO 作为激活空间中的导向向量扰动
机器学习
2025-12-16 v1
摘要
直接偏好优化(DPO)已成为对齐大语言模型的标准方法,但目前尚不清楚它实际上在网络内部引发了何种改变。本文论证 DPO 并未重写模型的内部信念;相反,它作为一种低秩导向机制,沿少量偏好方向推动激活。通过一个简单的推导,我们表明 DPO 梯度仅依赖于偏好完成与不偏好完成之间逻辑值嵌入的差异,意味着最终隐藏表示的一阶偏移而非语义的深层重构。然后,我们从经过 DPO 微调的模型中提取经验导向向量,并证明将该向量添加到基础激活中可以复现大部分对齐行为,而减去该向量几乎可以恢复原始模型。最后,谱分析揭示了上层中的秩一主导性和熵坍缩,表明对齐通过一个狭窄子空间集中。综合来看,这些结果支持 DPO 的行为幻觉观点:它教会模型如何表现对齐,而非相信什么是对齐的。
引用
@article{arxiv.2512.11838,
title = {D-STEER - Preference Alignment Techniques Learn to Behave, not to Believe -- Beneath the Surface, DPO as Steering Vector Perturbation in Activation Space},
author = {Samarth Raina and Saksham Aggarwal and Aman Chadha and Vinija Jain and Amitava Das},
journal= {arXiv preprint arXiv:2512.11838},
year = {2025}
}