用于自我中心动作识别的多模态蒸馏
计算机视觉与模式识别
2023-07-19 v2
摘要
自我中心视频理解的核心在于建模手-物交互。以 RGB 帧为输入的标准模型(如 CNN 或 Vision Transformer)表现良好。然而,通过采用提供互补线索的额外输入模态(如物体检测、光流、音频等),其性能可进一步提升。但模态专用模块的额外复杂性使这些模型难以实际部署。本工作的目标是在推理时仅使用 RGB 帧作为输入,同时保留此类多模态方法的性能。我们证明,在 Epic-Kitchens 与 Something-Something 数据集上的自我中心动作识别中,受多模态教师模型教导的学生比以单模态或多模态方式在真值标签上训练的结构等价模型更准确且校准更好。我们进一步采用一种有原则的多模态知识蒸馏框架,以应对朴素应用多模态知识蒸馏时出现的问题。最后,我们展示了所实现的计算复杂度降低,并表明在减少输入视角数量时我们的方法仍保持更高性能。我们在 https://github.com/gorjanradevski/multimodal-distillation 发布了代码。
引用
@article{arxiv.2307.07483,
title = {Multimodal Distillation for Egocentric Action Recognition},
author = {Gorjan Radevski and Dusan Grujicic and Marie-Francine Moens and Matthew Blaschko and Tinne Tuytelaars},
journal= {arXiv preprint arXiv:2307.07483},
year = {2023}
}
备注
Accepted at ICCV 2023; Codebase released at https://github.com/gorjanradevski/multimodal-distillation