架构驱动偏移:面向轻量级选择器捕捉逻辑偏移趋势
机器学习
2026-05-28 v1 人工智能
摘要
持续学习(Continual Learning, CL)是一种实用方法,旨在利用深度预训练神经网络的能力,但哪种预训练模型能够更好地平衡“可塑性-稳定性”(plasticity-stability)仍值得被选择。逻辑偏移(logit shift)作为一种自然代理指标,因为其代表了持续学习场景中的逻辑偏移。然而获取逻辑偏移需要巨大的计算成本,这阻碍了大规模模型选择。现有的理论分析因假设隐藏层宽度均匀而无法提供有效替代方案,这忽略了现实架构中结构异质性(可变宽度和深度)的存在。这引出一个关键问题:在已训练任务上的异构架构与逻辑偏移之间是否存在理论关系?为了回答此问题,我们将逻辑偏移解耦为架构依赖性和数据依赖性,以建立框架,揭示这两种依赖性的组合(定义为架构驱动偏移,Architecture-driven Shift, ADS)能够较少数据样本良好地捕捉逻辑偏移趋势。具体而言,对于在先前任务上经过优化的模型而言,ADS越高,训练当前任务后产生的逻辑偏移就越大,这基于三个机制性组件:(1)权重矩阵梯度的谱范缩放随层宽变化;(2)新任务的优化路径长度;(3)宽网络中的渐近任务冲突。广泛的实验结果覆盖超过175种多样化架构,证明ADS与逻辑偏移之间存在强烈的单调相关性(最弱的斯佩尔相关系数)。在实际应用中,我们展示ADS可作为期望校准误差(expected calibration error)的轻量级代理,这是可靠持续学习模型选择中广泛使用的数值指标,在三个数据集上的六种情景中得以验证。
引用
@article{arxiv.2605.27469,
title = {Architecture-driven Shift: towards a lightweight selector for capturing the trends of logit shift},
author = {Zhong Ye and Yu Hu and Ruilin Tang},
journal= {arXiv preprint arXiv:2605.27469},
year = {2026}
}