探寻深层中间表示的潜在潜能
机器学习
2026-05-25 v1 人工智能
摘要
基础模型通过大规模数据预训练学习到的表示会随深度演变,形成语义内容和几何结构各异的嵌入层级。与仅使用最终一层或浅层混合表示的常规做法不同,我们展示任务相关信息在各层之间非单调分布,无法通过简单聚合恢复。通过跨模态的几何与实证研究,我们表明有效的迁移学习取决于识别哪些层编码任务判别性结构以及其嵌入的几何组织方式。我们引入了层级最优嵌入选择方法(LOES),这是一种构造性谱方法,通过最小化残差误差并施加正交性和各向同性约束,来识别任务判别性子空间。为使微调符合这一选择原则,我们进一步提出了几何正则化损失(GeoReg),它在类别流形上强制单纯结构并稳定微调期间的表示几何。在广泛的架构、深度、模态和数据规模下,LOES 始终优于标准基线, gains 随模型深度增加而增大。除准确率外,我们的方法揭示了语义因素如何在各层之间分布,从而实现跨语言和跨模态的可解释性分析。综上所述,我们的结果提供了强有力的证据表明,层级嵌入几何并非偶然现象,而是深层模型表示与知识迁移的核心因素。
引用
@article{arxiv.2605.23033,
title = {Uncovering the Latent Potential of Deep Intermediate Representations},
author = {Arnesh Batra and Arush Gumber and Aniket Khandelwal and Jashn Khemani and Anubha Gupta},
journal= {arXiv preprint arXiv:2605.23033},
year = {2026}
}
备注
Accepted to ICML2026 as a Spotlight