Theseus 之网络
机器学习
2025-12-05 v1 人工智能
计算与语言
摘要
深度学习中的一个标准假设是:神经网络架构在训练期间引入的归纳偏置必须持续存在于推理期间。您训练的架构即是您部署的架构。这一假设限制了社区选择可能因优化困难而具有更好效率或设计属性的架构。我们以 Network of Theseus (NoT) 挑战这一假设,这是一种逐步将训练得甚至未训练的指导网络架构的各个组成部分转换为 entirely 不同目标网络架构的方法,以保持指导网络的性能。在每个阶段,指导网络中的组件逐个被替换为目标架构模块,并通过表示相似性指标进行对齐。这一程序即使在重大架构变更下(例如,将卷积网络转换为多层感知器,或将 GPT-2 转换为循环神经网络)也能较大程度地保留指导网络的功能。通过将优化与部署解耦,NoT 扩大了可行的推理时间架构空间,为更好的准确率-效率权衡和更有针对性的架构设计空间探索提供了机遇。
关键词
引用
@article{arxiv.2512.04198,
title = {Network of Theseus (like the ship)},
author = {Vighnesh Subramaniam and Colin Conwell and Boris Katz and Andrei Barbu and Brian Cheung},
journal= {arXiv preprint arXiv:2512.04198},
year = {2025}
}
备注
Preprint. 24 pages, 9 figures, 8 tables