面向缺失模态的基于多模态知识蒸馏的体景动作识别
计算机视觉与模式识别
2026-03-02 v3
摘要
体景动作识别使机器人能够促进人机交互并监控任务进度。现有方法常仅依赖RGB视频,尽管额外的模态(如音频)在挑战性条件下可提升准确率。然而,大多数多模态方法在推理时假设所有模态均可用,导致输入缺失时准确率显著下降,甚至出现失效。为此,我们提出KARMMA(Knowledge distillation framework for egocentric Action Recognition robust to Missing ModAlities),一种无需在训练或推理中对所有样本进行模态对齐的多模态知识蒸馏框架。KARMMA将多模态教师模型的知识蒸馏至能够利用所有可用模态且对缺失模态鲁棒的多模态学生模型,从而实现跨不同传感器配置的部署,无需重新训练。我们的学生模型约需教师模型50%的计算资源,构建出轻量级高速模型,适用于机器人端部署。在Epic-Kitchens和Something-Something数据集上实验表明,学生模型在竞争性准确率下,显著降低了缺失模态情况下的性能下降。
引用
@article{arxiv.2504.08578,
title = {Multimodal Knowledge Distillation for Egocentric Action Recognition Robust to Missing Modalities},
author = {Maria Santos-Villafranca and Dustin Carrión-Ojeda and Alejandro Perez-Yus and Jesus Bermudez-Cameo and Jose J. Guerrero and Simone Schaub-Meyer},
journal= {arXiv preprint arXiv:2504.08578},
year = {2026}
}
备注
Project Page: https://visinf.github.io/KARMMA