中文

输入凸神经网络训练的一种升力

机器学习 2026-05-26 v1 机器学习

摘要

输入凸神经网络(ICNN)在对数凹密度估计、凸潜力归一化流、最优传输以及用于高维贝叶斯后验的传输图反演中广泛应用。这些任务共享一种结构约束:ICNN的跨层权重必须保持非负。标准做法是对非负锥进行投影梯度下降(PGD),采用硬、非光滑投影——即ADMM风格约束分解的刚性惩罚极限,其经典收敛保证无法直接应用于非光滑ICNN训练景观;可微替代方法是softplus重新参数化,它在权重幅值增大时会指数性地衰减梯度,导致训练停滞,出现死亡的跨层权重和损失平台化。灵感来源于偏微分方程约束逆问题的参数扩展提升,我们提出了升力:即不直接约束跨层权重,而是训练一个无约束的超网络,其从输入小批的置换不变摘要中发射权重。这引入了训练动力学中的随机性,使损失景观变得柔和,使迭代能够逃离直接softplus停滞的梯度衰减区域。我们将这种柔和归因追溯到三个结构性要素——作为松弛量的可学习偏置、能够对目标小批进行条件化的超网络主体,以及通过小批随机性将两者耦合的交叉协方差——并证明每个要素都是必要的:删除任何单个要素都会导致软化的协方差崩溃。在从一维玩具目标到图像风格的潜在空间,以及针对21维制表基准上的凸潜力归一化流上,我们表明升力能够获得低于PGD和直接softplus的更低测试损失,使受限训练轨迹转为谷底下降轨迹。

关键词

引用

@article{arxiv.2605.24274,
  title  = {A lift for input-convex neural network training},
  author = {Ali Siahkoohi and Anirudh Thatipelli},
  journal= {arXiv preprint arXiv:2605.24274},
  year   = {2026}
}