中文

MGDA在广义光滑性下可证明收敛

机器学习 2025-03-11 v5 最优化与控制 机器学习

摘要

多目标优化(MOO)在多任务学习等各个领域受到越来越多的关注。最近的工作提供了一些具有理论分析的有效算法,但它们受限于标准的LL-光滑或有界梯度假设,这些假设通常不适用于神经网络,例如长短期记忆(LSTM)模型和Transformer。在本文中,我们研究了一类更一般、更现实的广义\ell-光滑损失函数,其中\ell是梯度范数的一般非递减函数。我们重新审视并分析了基本的多梯度下降算法(MGDA)及其带双重采样的随机版本,用于求解广义\ell-光滑MOO问题,这些算法近似于冲突避免(CA)方向,该方向最大化目标之间的最小改进。我们提供了这些算法的全面收敛性分析,并证明它们收敛到一个ϵ\epsilon-精确的Pareto驻点,并在所有迭代中保证ϵ\epsilon水平的平均CA距离(即更新方向与CA方向之间的差距),其中确定性和随机设置分别总共需要O(ϵ2)\mathcal{O}(\epsilon^{-2})O(ϵ4)\mathcal{O}(\epsilon^{-4})个样本。我们证明,使用更多样本,它们还可以在每次迭代中保证更紧的ϵ\epsilon水平CA距离。此外,我们分析了一个高效的MGDA变体,名为MGDA-FA,它仅使用O(1)\mathcal{O}(1)的时间和空间,同时实现与MGDA相同的性能保证。

关键词

引用

@article{arxiv.2405.19440,
  title  = {MGDA Converges under Generalized Smoothness, Provably},
  author = {Qi Zhang and Peiyao Xiao and Shaofeng Zou and Kaiyi Ji},
  journal= {arXiv preprint arXiv:2405.19440},
  year   = {2025}
}