中文

SPINAL——神经对齐层中的比例律与偏好集成

机器学习 2026-01-13 v1 人工智能 计算与语言

摘要

直接偏好优化(DPO)是一种以成对偏好为基础对大型语言模型进行对齐的原则且可扩展的替代方案,相较于RLHF,但其内部几何轮廓仍未充分刻画,限制了审计、检查点比较和失效预测。我们引入SPINAL(Scaling-law and Preference Integration in Neural Alignment Layers),这是一种诊断工具,衡量对齐如何在深度层面重塑表示,通过逐层追踪局部结构变化来实现。跨模型族,DPO在最终解码器块(通常是第21-30层)中产生层级校准效应,其中偏好梯度最直接影响下一个标记的分布。SPINAL将每个检查点编码为深度轨迹(layer index, contraction score, transport score)。收缩得分概括了该层谱尾如何迅速衰减(小模式消失的速度);得分越高,表明收缩得越强,向更少的有效方向收敛。传输得分概括了相邻层之间标记分布偏移的程度,使用受限的重叠度量衡量;得分越低,表明通过表示空间的步幅越短、越平滑。对齐的检查点显示出在收缩和传输方面呈现后期层级提升,表明政策质量被紧密且稳定的化;而未对齐的模型则绘制出更高曲率、更熵且几何上不连贯的深度路径。总体而言,对齐是几何上局部化的:最终层编码主导性的偏好诱导校正。SPINAL将这种局部化转化为实用的审计信号,量化对齐集中处、其强度以及何时开始在训练期间失效。

关键词

引用

@article{arxiv.2601.06238,
  title  = {SPINAL -- Scaling-law and Preference Integration in Neural Alignment Layers},
  author = {Arion Das and Partha Pratim Saha and Amit Dhanda and Vinija Jain and Aman Chadha and Amitava Das},
  journal= {arXiv preprint arXiv:2601.06238},
  year   = {2026}
}