DisCoM-KD:通过解耦表示和对抗学习进行跨模态知识蒸馏
机器学习
2024-08-15 v1 人工智能
计算机视觉与模式识别
摘要
跨模态知识蒸馏(CMKD)是指学习框架必须处理训练和测试数据呈现模态不匹配的场景,更精确地说,训练和测试数据不覆盖相同的数据模态集合。CMKD的传统方法基于教师/学生范式,其中教师在多模态数据上训练,旨在将知识从多模态教师逐步蒸馏到单模态学生。尽管这种范式被广泛采用,但近期研究揭示了其在跨模态知识迁移中的固有局限性。超越教师/学生范式,我们引入了一种新的跨模态知识蒸馏框架,命名为DisCoM-KD(基于解耦学习的跨模态知识蒸馏),它明确建模不同类型的每模态信息,旨在将知识从多模态数据转移到单模态分类器。为此,DisCoM-KD有效地结合了解耦表示学习与对抗域适应,以同时提取每种模态的域不变、域信息和域无关特征,具体取决于特定的下游任务。与传统的教师/学生范式不同,我们的框架同时学习所有单模态分类器,消除了分别学习每个学生模型以及教师分类器的需要。我们在三个标准多模态基准上评估了DisCoM-KD,并将其行为与近期SOTA知识蒸馏框架进行了比较。结果清楚地表明DisCoM-KD在涉及重叠和非重叠模态的不匹配场景下优于竞争对手。这些结果为重新考虑从多模态数据向单模态神经网络蒸馏信息的传统范式提供了见解。
引用
@article{arxiv.2408.07080,
title = {DisCoM-KD: Cross-Modal Knowledge Distillation via Disentanglement Representation and Adversarial Learning},
author = {Dino Ienco and Cassio Fraga Dantas},
journal= {arXiv preprint arXiv:2408.07080},
year = {2024}
}