中文

面向缺失模态多模态学习的可学习跨模态知识蒸馏

计算机视觉与模式识别 2025-03-17 v2 机器学习

摘要

缺失模态问题在多模态模型中既关键又不平凡,亟需妥善处理。在多模态任务中,某些模态相较于其他模态贡献更大是常见现象,若这些重要模态缺失,模型性能会显著下降。当前多模态方法通过特征重建或从其他模态盲目聚合特征来恢复缺失模态的表示,而非从表现最佳的模态中提取有用信息,这一事实尚未被探索。本文提出一种可学习跨模态知识蒸馏(LCKD)模型,自适应识别重要模态并从中蒸馏知识,从跨模态视角帮助其他模态解决缺失模态问题。我们的方法引入教师选举过程,基于各模态在特定任务上的单模态表现选出最“合格”的教师。然后,针对每个任务在教师模态与学生模态间执行跨模态知识蒸馏,将模型参数推向对所有任务均有利的点。因此,即便测试时某些任务的教师模态缺失,可用的学生模态也能基于从自动选举的教师模态学到的知识足够好地完成任务。在脑肿瘤分割数据集2018(BraTS2018)上的实验表明,LCKD以可观优势优于其他方法,在分割Dice分数上分别将增强肿瘤、肿瘤核心和全肿瘤的最优性能提升了3.61%、5.99%和3.76%。

关键词

引用

@article{arxiv.2310.01035,
  title  = {Learnable Cross-modal Knowledge Distillation for Multi-modal Learning with Missing Modality},
  author = {Hu Wang and Congbo Ma and Jianpeng Zhang and Yuan Zhang and Jodie Avery and Louise Hull and Gustavo Carneiro},
  journal= {arXiv preprint arXiv:2310.01035},
  year   = {2025}
}