中文

GradNorm:深度多任务网络中用于自适应损失平衡的斜率归一化

计算机视觉与模式识别 2018-07-16 v4

摘要

深度多任务网络使用一个神经网络产生多个预测输出,相比单任务网络可提供更好的速度和性能,但难以正确训练。我们提出一种梯度归一化(GradNorm)算法,通过动态调节梯度大小来自动平衡深度多任务模型的训练。我们表明,对于多种网络架构、回归与分类任务,以及在合成与真实数据集上,与单任务网络、静态基线及其他自适应多任务损失平衡技术相比,GradNorm 在多个任务上提升了准确率并减少了过拟合。GradNorm 还匹配或超越了穷举网格搜索方法的性能,尽管仅涉及一个非对称超参数 α\alpha。因此,曾经那种每新增一个任务便带来指数级计算开销的繁琐搜索过程,如今可在少量训练轮次内完成,且与任务数量无关。最终,我们将证明梯度操控使我们能极大控制多任务网络的训练动态,并可能是释放多任务学习潜力的关键之一。

关键词

引用

@article{arxiv.1711.02257,
  title  = {GradNorm: Gradient Normalization for Adaptive Loss Balancing in Deep Multitask Networks},
  author = {Zhao Chen and Vijay Badrinarayanan and Chen-Yu Lee and Andrew Rabinovich},
  journal= {arXiv preprint arXiv:1711.02257},
  year   = {2018}
}

备注

ICML 2018