中文

基于跨模态知识蒸馏增强多模态表示学习

计算机视觉与模式识别 2023-06-14 v1 多媒体

摘要

本文探讨了利用仅在训练时可用的辅助模态,通过跨模态知识蒸馏(KD)来增强多模态表示学习的任务。被广泛采用的基于互信息最大化的目标会导致弱教师模型的捷径解,即通过简单使教师模型弱于学生模型来实现最大互信息。为防止此类弱解,我们引入一个额外的目标项,即教师模型与辅助模态模型之间的互信息。此外,为缩小学生与教师之间的信息差距,我们进一步提出最小化给定学生时教师的条件熵。我们设计了基于对比学习和对抗学习的新型训练方案,分别用于优化互信息和条件熵。在三个流行多模态基准数据集上的实验结果表明,所提方法在视频识别、视频检索和情感分类上优于一系列最先进的方法。

关键词

引用

@article{arxiv.2306.07646,
  title  = {Enhanced Multimodal Representation Learning with Cross-modal KD},
  author = {Mengxi Chen and Linyu Xing and Yu Wang and Ya Zhang},
  journal= {arXiv preprint arXiv:2306.07646},
  year   = {2023}
}

备注

Accepted by CVPR2023