中文

刻画并克服多模态深度神经网络中学习的贪婪特性

机器学习 2022-09-20 v3 计算机视觉与模式识别

摘要

我们假设,由于多模态深度神经网络中学习的贪婪特性,这些模型倾向于仅依赖一种模态,而对其他模态拟合不足。正如我们通过实验观察到的,这种行为违反直觉并损害模型的泛化能力。为了估计模型对每种模态的依赖程度,我们计算当模型在已有另一种模态的基础上额外获得该模态时准确率的增益。我们将此增益称为条件利用率。在实验中,我们一致观察到跨多种任务和架构的模态间条件利用率存在不平衡。由于条件利用率在训练期间无法高效计算,我们引入了一个基于模型从每种模态学习速度的代理指标,称之为条件学习速度。我们提出了一种算法来在训练期间平衡模态间的条件学习速度,并证明它确实解决了贪婪学习的问题。所提出的算法在三个数据集上提升了模型的泛化能力:Colored MNIST、ModelNet40 和 NVIDIA Dynamic Hand Gesture。

关键词

引用

@article{arxiv.2202.05306,
  title  = {Characterizing and overcoming the greedy nature of learning in multi-modal deep neural networks},
  author = {Nan Wu and Stanisław Jastrzębski and Kyunghyun Cho and Krzysztof J. Geras},
  journal= {arXiv preprint arXiv:2202.05306},
  year   = {2022}
}