由多模态教师指导的学生是更优的动作识别器
计算机视觉与模式识别
2022-10-11 v1
摘要
以自我为中心视频理解的核心是建模手-物交互。标准模型——CNN、Vision Transformer等——以RGB帧作为输入表现良好,然而,通过采用目标检测、光流、音频等额外模态作为输入,其性能可进一步提升。另一方面,所需模态特定模块的额外复杂性使得这些模型难以实际部署。本工作的目标是在仅以RGB图像作为推理时输入的同时,保留此类多模态方法的性能。我们的方法基于多模态知识蒸馏,包含一个多模态教师(在当前实验中仅使用目标检测、光流和RGB帧训练)和一个单模态学生(仅使用RGB帧作为输入)。我们给出的初步结果表明,从多模态教师蒸馏得到的模型在标准动作识别和组合动作识别中,均显著优于基线RGB模型(无知识蒸馏训练)及其自身的杂食版本(在所有模态上联合训练)。
引用
@article{arxiv.2210.04331,
title = {Students taught by multimodal teachers are superior action recognizers},
author = {Gorjan Radevski and Dusan Grujicic and Matthew Blaschko and Marie-Francine Moens and Tinne Tuytelaars},
journal= {arXiv preprint arXiv:2210.04331},
year = {2022}
}
备注
Extended abstract accepted at the 2nd Ego4D Workshop @ ECCV 2022