MGDA在广义光滑性下可证明收敛
机器学习
2025-03-11 v5 最优化与控制
机器学习
摘要
多目标优化(MOO)在多任务学习等各个领域受到越来越多的关注。最近的工作提供了一些具有理论分析的有效算法,但它们受限于标准的-光滑或有界梯度假设,这些假设通常不适用于神经网络,例如长短期记忆(LSTM)模型和Transformer。在本文中,我们研究了一类更一般、更现实的广义-光滑损失函数,其中是梯度范数的一般非递减函数。我们重新审视并分析了基本的多梯度下降算法(MGDA)及其带双重采样的随机版本,用于求解广义-光滑MOO问题,这些算法近似于冲突避免(CA)方向,该方向最大化目标之间的最小改进。我们提供了这些算法的全面收敛性分析,并证明它们收敛到一个-精确的Pareto驻点,并在所有迭代中保证水平的平均CA距离(即更新方向与CA方向之间的差距),其中确定性和随机设置分别总共需要和个样本。我们证明,使用更多样本,它们还可以在每次迭代中保证更紧的水平CA距离。此外,我们分析了一个高效的MGDA变体,名为MGDA-FA,它仅使用的时间和空间,同时实现与MGDA相同的性能保证。
引用
@article{arxiv.2405.19440,
title = {MGDA Converges under Generalized Smoothness, Provably},
author = {Qi Zhang and Peiyao Xiao and Shaofeng Zou and Kaiyi Ji},
journal= {arXiv preprint arXiv:2405.19440},
year = {2025}
}