中文

面向动作识别的样本级自适应知识蒸馏

计算机视觉与模式识别 2025-07-08 v1

摘要

知识蒸馏(KD)通过将知识从预训练大型网络(教师)迁移到小型网络(学生)来压缩神经网络。尽管已在图像领域大量探索,但针对视频分析的工作鲜有涉及,由于视频分析需要训练更大模型,难以在资源受限的设备上部署。然而,传统方法忽视了两个重要问题:1)由于教师与学生之间的能力差距,某些难以迁移的样本知识可能无法正确传递,甚至严重影响学生的最终性能;2)随着训练进行,难以迁移的样本可能变得更易学习,反之亦然。为缓解上述问题,本文提出了面向动作识别的样本级自适应知识蒸馏(SAKD)框架。具体包括样本蒸馏难度评估模块和样本自适应蒸馏模块。前者通过对帧进行随机丢弃或随机排列的时序中断,增加蒸馏期间样本的学习难度,从而更好地区分样本的蒸馏难度。后者模块在样本级别自适应调整蒸馏比例,使得难以迁移的样本训练时以常规损失为主,而易于迁移的样本训练时以KD损失为主。更重要的是,只选择蒸馏难度低且多样性高的样本来训练学生模型,以减少计算成本。在两个视频基准数据集和一个图像基准数据集上的实验结果表明,所提方法在性能和效率之间取得了显著平衡,优于现有方法。

关键词

引用

@article{arxiv.2504.00606,
  title  = {Sample-level Adaptive Knowledge Distillation for Action Recognition},
  author = {Ping Li and Chenhao Ping and Wenxiao Wang and Mingli Song},
  journal= {arXiv preprint arXiv:2504.00606},
  year   = {2025}
}