训练不可训练者:通过表示对齐引入归纳偏置
机器学习
2025-10-27 v2 人工智能
计算与语言
摘要
我们证明,传统上被认为不适合某项任务的架构可以利用来自另一架构的归纳偏置进行训练。当网络出现过拟合、欠拟合,或者即使调整超参数也收敛到较差结果时,我们称之为不可训练的。例如,全连接网络在物体识别上过拟合,而没有残差连接的深度卷积网络欠拟合。传统的答案是改变架构以施加某种归纳偏置,尽管该偏置的性质是未知的。我们引入了指导,其中指导网络使用神经距离函数引导目标网络。目标网络最小化其任务损失加上与冻结的指导网络之间的逐层表示相似性。如果指导网络是已训练的,这会将指导网络的架构先验和知识迁移到目标网络。如果指导网络是未训练的,这仅迁移指导网络的部分架构先验。我们表明,指导防止了 FCN 在 ImageNet 上的过拟合,缩小了普通 RNN 与 Transformer 之间的差距,将普通 CNN 的准确率提升至接近 ResNet,并在 RNN 占优的任务上辅助 Transformer。我们进一步发现,仅靠指导驱动的初始化即可缓解 FCN 过拟合。我们的方法提供了一种研究先验和架构的数学工具,从长远来看,可以实现架构设计的自动化。
引用
@article{arxiv.2410.20035,
title = {Training the Untrainable: Introducing Inductive Bias via Representational Alignment},
author = {Vighnesh Subramaniam and David Mayo and Colin Conwell and Tomaso Poggio and Boris Katz and Brian Cheung and Andrei Barbu},
journal= {arXiv preprint arXiv:2410.20035},
year = {2025}
}
备注
NeurIPS 2025; 39 pages, 18 figures, 6 tables; Project page and code is at https://untrainable-networks.github.io/