中文

多模态知识扩展

计算机视觉与模式识别 2021-11-01 v3 机器学习 多媒体

摘要

多模态传感器的普及与互联网的便捷为我们带来了海量无标注多模态数据。由于现有数据集与训练良好的模型主要为单模态,单模态网络与无标注多模态数据之间的模态鸿沟带来了一个有趣的问题:如何将预训练的单模态网络迁移以在无标注多模态数据上执行相同任务?本工作中,我们提出多模态知识扩展(MKE),一种基于知识蒸馏的框架,可在无需标签的情况下有效利用多模态数据。与传统知识蒸馏中学生网络被设计为轻量且弱于教师网络相反,我们观察到多模态学生模型能持续对伪标签去噪并比其教师泛化更好。在四个任务与不同模态上的大量实验验证了该发现。此外,我们将 MKE 的机制与半监督学习相联系,并提供经验与理论解释以理解多模态学生的去噪能力。

关键词

引用

@article{arxiv.2103.14431,
  title  = {Multimodal Knowledge Expansion},
  author = {Zihui Xue and Sucheng Ren and Zhengqi Gao and Hang Zhao},
  journal= {arXiv preprint arXiv:2103.14431},
  year   = {2021}
}

备注

Accepted by ICCV 2021. Project website: https://tsinghua-mars-lab.github.io/MKE/