隐蔽特征传播即表征对齐:来自隐藏通道蒸馏的机制证据
机器学习
2026-07-05 v1 人工智能
摘要
在纯均匀噪声上训练的学生模型,只要与教师模型共享初始化,仍能继承其数字分类能力。先前的工作证明了当教师学习率足够小时这种迁移是有保证的,但并未解释通道在网络中的位置或其容量由什么决定。在 MNIST 上的 MLP 蒸馏环境中,我们证明这些通道并非纯粹信息性的:几何对齐控制了对通道所承载信息的访问。共享初始化使输出投影 W_2 成为公共坐标键,KL 梯度重塑学生的输入投影 W_0,直到其隐藏表征与教师对齐。我们称之为隐蔽特征传播(CTP)。五个实验支持这一机制:通道闭合追踪权重漂移而非教师准确率;冻结 W_0 破坏迁移,而冻结 W_2 则保持迁移;尽管每个教师携带相当的标签信息,多教师集成却相互抵消;线性中心核对齐(CKA)在连续初始化扫描中追踪学生准确率,r=0.98。将相同的几何视角应用于指令调优 LLM 中的跨令牌行为纠缠(CTBE),我们发现该效应似乎由对齐训练激活,作用于继承的基底上,并且标准的对数比率度量产生的明显频率偏差在很大程度上是循环性伪影。
引用
@article{arxiv.2607.04432,
title = {Covert Trait Propagation Is Representation Alignment: Mechanistic Evidence from Hidden-Channel Distillation},
author = {Kargi Chauhan and Aditya Shah},
journal= {arXiv preprint arXiv:2607.04432},
year = {2026}
}