中文

重新审视跨模态知识蒸馏:一种面向 RGBD 语义分割的解耦方法

计算机视觉与模式识别 2025-06-02 v1

摘要

多模态 RGB 和 Depth(RGBD)数据在机器人、自动驾驶和遥感等诸多领域占据主导地位。这些多模态数据的结合通过提供标准 RGB 图像所缺失的三维空间上下文,增强了环境感知能力。尽管在训练计算机视觉模型时可以使用 RGBD 多模态数据,但由于传感器故障或资源限制,在推理阶段访问所有传感器模态可能并不可行,从而导致训练和推理期间可用数据模态之间的不匹配。为解决该任务而开发的传统跨模态知识蒸馏(Cross-Modal Knowledge Distillation, CMKD)框架通常基于教师/学生范式,即多模态教师模型将知识蒸馏到单模态学生模型中。然而,这些方法在教师架构选择和蒸馏过程设计上面临挑战,从而限制了其在实际场景中的应用。为了克服这些问题,我们引入了 CroDiNo-KD(Cross-Modal Disentanglement: a New Outlook on Knowledge Distillation),一种用于 RGBD 语义分割的新型跨模态知识蒸馏框架。该方法通过利用解耦表示、对比学习和解耦数据增强,同时学习单模态 RGB 和 Depth 模型,旨在通过交互与协作来构建神经网络模型的内部流形。我们在跨越不同领域的三个 RGBD 数据集上评估了 CroDino-KD,并将近期的 CMKD 框架作为竞争对手。我们的结果展示了 CroDiNo-KD 的优越质量,并表明应当重新考虑传统的教师/学生范式,以将多模态数据中的信息蒸馏到单模态神经网络中。

关键词

引用

@article{arxiv.2505.24361,
  title  = {Revisiting Cross-Modal Knowledge Distillation: A Disentanglement Approach for RGBD Semantic Segmentation},
  author = {Roger Ferrod and Cássio F. Dantas and Luigi Di Caro and Dino Ienco},
  journal= {arXiv preprint arXiv:2505.24361},
  year   = {2025}
}