中文

MST-Distill:用于跨模态知识蒸馏的专用教师混合模型

计算机视觉与模式识别 2025-07-10 v1 机器学习 多媒体

摘要

知识蒸馏作为一种高效的知识传递技术,在单模态场景中取得了显著的成功。然而,在跨模态设置中,传统蒸馏方法由于数据和统计异质性,面临着显著挑战,无法充分利用跨模态教师模型中嵌入的互补先验知识。本文经验性地揭示了现有方法中的两个关键问题:蒸馏路径选择和知识漂移。为解决这些限制,我们提出了MST-Distill,一种具有专用教师混合模型的新型跨模态知识蒸馏框架。我们的方法采用跨模态和多模态配置中多样化的教师模型集合,并集成一个实例级路由网络,以实现自适应和动态的蒸馏。这种架构有效地超越了依赖单调和静态教师模型的传统方法的限制。此外,我们引入了一个插件式掩码模块,独立训练以抑制模式特定的差异并重建教师表示,从而缓解知识漂移并增强传递效果。在覆盖视觉、音频和文本等五个多样化多模态数据集的广泛实验中,结果表明该方法在跨模态蒸馏任务中显著优于现有最先进的知识蒸馏方法。

关键词

引用

@article{arxiv.2507.07015,
  title  = {MST-Distill: Mixture of Specialized Teachers for Cross-Modal Knowledge Distillation},
  author = {Hui Li and Pengfei Yang and Juanyang Chen and Le Dong and Yanxin Chen and Quan Wang},
  journal= {arXiv preprint arXiv:2507.07015},
  year   = {2025}
}

备注

Accepted to ACM MM 2025 (The 33rd ACM International Conference on Multimedia)