ODE-Net 作为平均场最优控制问题的变分表述及存在性结果
偏微分方程分析
2024-10-22 v4 机器学习
最优化与控制
摘要
本文对深度神经网络(DNNs)的连续统模型 ODE-Net 进行数学分析。近年来,机器学习研究者引入以常微分方程作为连续极限来替代 DNN 深层结构的想法。这些研究将 ODE-Net 的“学习”视为受参数化 ODE 约束的“损失”最小化。尽管该最小化问题极小元的存在性需要被假定,但仅有少数研究详细解析地考察了其存在性。本文基于将 ODE-Net 表述为测度论平均场最优控制问题来讨论极小元的存在性。当描述 ODE-Net 向量场的神经网络关于可学习参数线性时,证明了存在性结果。证明采用测度论表述结合变分法直接方法。其次,提出一个理想化最小化问题以去除上述线性假设。该问题受关联于 Benamou--Brenier 公式的动力学正则化及神经网络通用逼近定理启发。这些存在性结果的证明使用了变分法、微分方程与平均场最优控制理论。它们将作为一种研究深度神经网络学习过程的新的解析途径。
引用
@article{arxiv.2303.05924,
title = {Variational formulations of ODE-Net as a mean-field optimal control problem and existence results},
author = {Noboru Isobe and Mizuho Okumura},
journal= {arXiv preprint arXiv:2303.05924},
year = {2024}
}
备注
Accepted for publication in the Journal of Machine Learning