You Only Train Once
机器学习
2025-06-06 v1 计算机视觉与模式识别
摘要
论文标题或许显得夸大。当然,创建和优化所学模型的过程中不可避免地涉及多次训练运行,这些运行可能具有不同的架构设计、输入输出编码以及损失函数。然而,我们的方法 You Only Train Once (YOTO) 确实致力于限制后者(损失函数选择与加权)只进行一次训练。我们通过将损失权重超参数视为网络的常规参数,并利用标准梯度基于优化方法对其进行单次优化,从而实现这一目标。为此,我们利用复合损失函数的可微性,该函数广泛用于同时优化多个经验损失,并将其建模为一个以 softmax 操作为参数的新型层,满足损失超参数固有的正性约束,同时避免经验梯度退化。我们通过定义一种针对所学超参数的新型正则化损失来完成其联合端到端优化方案,该正则化损失模拟了所用损失之间的均匀性先验,同时确保识别出的最优解具有界限性。我们通过在计算机视觉中解决两个关键问题(3D 估计和语义分割)的情形下,将其与常用粗暴网格搜索进行比较,证明了 YOTO 在联合优化损失超参数和常规模型参数方面的有效性,并显示其在未见测试数据上的表现始终优于最佳网格搜索模型。代码将对公众开放。
引用
@article{arxiv.2506.04349,
title = {You Only Train Once},
author = {Christos Sakaridis},
journal= {arXiv preprint arXiv:2506.04349},
year = {2025}
}
备注
17 pages, 4 figures