利用单模态教师改进多模态学习
机器学习
2021-06-22 v1
摘要
学习多模态表征是迈向真实世界机器人应用的关键一步,为此已开发出多种多模态融合模型。然而,我们观察到现有模型的目标主要基于联合训练,往往难以学到各模态的低质表征。我们将此问题称为模态失效(Modality Failure),并假设模态间的不平衡以及融合方法中常见目标的隐式偏置,阻碍了各模态编码器进行充分的特征学习。为此,我们提出了一种新型多模态学习方法——单模态教师(Uni-Modal Teacher),它结合融合目标与单模态蒸馏来解决模态失效问题。我们表明,该方法不仅大幅改进了各模态的表征,也提升了整体多模态任务性能。我们的方法可有效泛化至大多数多模态融合方法。我们在VGGSound音视觉分类任务上取得了超过3%的提升,并改进了NYU depth V2 RGB-D图像分割任务的性能。
引用
@article{arxiv.2106.11059,
title = {Improving Multi-Modal Learning with Uni-Modal Teachers},
author = {Chenzhuang Du and Tingle Li and Yichen Liu and Zixin Wen and Tianyu Hua and Yue Wang and Hang Zhao},
journal= {arXiv preprint arXiv:2106.11059},
year = {2021}
}