Logit距离界限代表性相似性
机器学习
2026-02-20 v2 人工智能
机器学习
摘要
对于包括自回归语言模型在内的广泛判别模型族,辨识度结果表明,如果两个模型诱导相同的条件分布,则它们的内部表征在可逆线性变换下是一致的。我们询问,当分布接近而非相等时,是否存在类似的结论。基于尼尔森等人(2025年)观察到的:KL散度的接近性不一定导致高的线性表征相似性,我们研究基于logit差异的分布距离度量,证明该距离的接近性确实提供了线性相似性保证。具体而言,我们定义一种基于模型辨识度类别的表征不相似性度量,并证明其被logit距离所界限。进一步我们指出,当模型概率远离零时,KL散度上界可控logit距离;然而,由于实际应用中该界限无法提供实质性控制,基于KL的蒸馏可能匹配教师的预测,却未能保留线性表征属性,如人类可解释概念的线性探测可恢复性。在合成数据集和图像数据集上的蒸馏实验中,基于logit距离的蒸馏产生的学生模型在线性表征相似性和教师线性可恢复概念的保留方面表现更佳。
引用
@article{arxiv.2602.15438,
title = {Logit Distance Bounds Representational Similarity},
author = {Beatrix M. G. Nielsen and Emanuele Marconato and Luigi Gresele and Andrea Dittadi and Simon Buchholz},
journal= {arXiv preprint arXiv:2602.15438},
year = {2026}
}