中文

通过渐进知识蒸馏提高压缩视频动作识别

计算机视觉与模式识别 2024-07-04 v1 机器学习

摘要

压缩视频动作识别通过利用压缩视频中的不同模态(即运动向量、残差和帧内帧)来对视频样本进行分类。为此,部署了三个神经网络,每个网络专用于处理一种模态。我们的观察表明,处理帧内帧的网络倾向于收敛到更平坦的最小值,而处理残差的网络随后收敛到更平坦的最小值,而运动向量网络则收敛到最坑的最小值。这一收敛层次结构激发了我们在模态之间进行知识传递以实现更平坦最小值(通常与更好泛化相关)的策略。基于此洞见,我们提出渐进知识蒸馏(PKD),这是一种在模态之间逐步传递知识的技术。该方法涉及在三个网络上附加早期退出(内部分类器IC)。PKD从运动向量网络开始,随后是残差,最后是帧内帧网络,依次提高IC的准确性。进一步,我们提出加权推理与缩放集成(WISE),其组合了IC的输出,使用学习到的权重提升推理期间的准确性。我们的实验表明,使用PKD训练IC相对于标准基于交叉熵的训练有效,显示出在UCF-101和HMDB-51数据集上分别提高了最高可达5.87%和11.42%。此外,WISE在UCF-101和HMDB-51上分别提高了最高可达4.28%和9.30%。

关键词

引用

@article{arxiv.2407.02713,
  title  = {Advancing Compressed Video Action Recognition through Progressive Knowledge Distillation},
  author = {Efstathia Soufleri and Deepak Ravikumar and Kaushik Roy},
  journal= {arXiv preprint arXiv:2407.02713},
  year   = {2024}
}