是什么让多模态分类网络的训练变得困难?
计算机视觉与模式识别
2020-04-06 v5 机器学习
摘要
考虑在一个具有多输入模态的任务上,对多模态网络与单模态网络进行端到端训练:多模态网络接收到更多信息,因此它应当匹配或优于其单模态对应网络。然而,在我们的实验中,我们观察到相反的情况:最佳单模态网络总是优于多模态网络。这一观察在不同模态组合、不同任务与基准上均一致。本文指出了造成此性能下降的两个主要原因:首先,多模态网络常因容量增大而易于过拟合。其次,不同模态以不同速率过拟合与泛化,因此以单一优化策略联合训练它们是次优的。我们用一种称为梯度混合(Gradient Blending)的技术来解决这两个问题,该技术基于各模态的过拟合行为计算最优混合。我们证明,梯度混合优于广泛使用的避免过拟合的基线方法,并在包括人体动作识别、自我中心动作识别与声学事件检测在内的多种任务上达到了最优精度。
引用
@article{arxiv.1905.12681,
title = {What Makes Training Multi-Modal Classification Networks Hard?},
author = {Weiyao Wang and Du Tran and Matt Feiszli},
journal= {arXiv preprint arXiv:1905.12681},
year = {2020}
}
备注
CVPR 2020