优化轨迹能否解释多任务迁移?
机器学习
2025-01-31 v2
摘要
尽管多任务训练在深度学习中已被广泛采用,但人们对多任务学习(MTL)如何影响泛化知之甚少。先前的工作推测 MTL 的负面影响源于训练过程中出现的优化挑战,并且已经提出了许多优化方法来提高多任务性能。然而,最近的研究表明,这些方法未能持续改善多任务泛化。在这项工作中,我们试图通过实证研究 MTL 如何影响任务的优化,以及这种影响是否能解释 MTL 对泛化的影响,来增进对这些失败的理解。我们表明,MTL 在训练早期就在单任务和多任务轨迹之间产生了泛化差距(在可比较的训练损失下的泛化差距)。然而,我们发现先前被提出用于解释单任务设置中泛化差距的优化轨迹因素,无法解释单任务和多任务模型之间的泛化差距。此外,我们表明任务之间的梯度冲突量与对任务优化的负面影响相关,但不能预测泛化。我们的工作揭示了 MTL 失败的根本原因,并且重要的是,对通用多任务优化算法的作用提出了疑问。
引用
@article{arxiv.2408.14677,
title = {Can Optimization Trajectories Explain Multi-Task Transfer?},
author = {David Mueller and Mark Dredze and Nicholas Andrews},
journal= {arXiv preprint arXiv:2408.14677},
year = {2025}
}
备注
13 pages; Published in TMLR