中文

利用单模态教师改进多模态学习

机器学习 2021-06-22 v1

摘要

学习多模态表征是迈向真实世界机器人应用的关键一步,为此已开发出多种多模态融合模型。然而,我们观察到现有模型的目标主要基于联合训练,往往难以学到各模态的低质表征。我们将此问题称为模态失效(Modality Failure),并假设模态间的不平衡以及融合方法中常见目标的隐式偏置,阻碍了各模态编码器进行充分的特征学习。为此,我们提出了一种新型多模态学习方法——单模态教师(Uni-Modal Teacher),它结合融合目标与单模态蒸馏来解决模态失效问题。我们表明,该方法不仅大幅改进了各模态的表征,也提升了整体多模态任务性能。我们的方法可有效泛化至大多数多模态融合方法。我们在VGGSound音视觉分类任务上取得了超过3%的提升,并改进了NYU depth V2 RGB-D图像分割任务的性能。

关键词

引用

@article{arxiv.2106.11059,
  title  = {Improving Multi-Modal Learning with Uni-Modal Teachers},
  author = {Chenzhuang Du and Tingle Li and Yichen Liu and Zixin Wen and Tianyu Hua and Yue Wang and Hang Zhao},
  journal= {arXiv preprint arXiv:2106.11059},
  year   = {2021}
}