中文

时序显著性引导的蒸馏:一个用于蒸馏视频数据集的可扩展框架

计算机视觉与模式识别 2025-05-28 v1 机器学习

摘要

数据集蒸馏(DD)已成为数据集压缩的强大范式,能够合成紧凑的替代数据集,近似大规模数据集的训练效用。尽管在蒸馏图像数据集方面取得了显著进展,但由于视频数据固有的高维度和时序复杂性,将DD扩展到视频领域仍然具有挑战性。现有的视频蒸馏(VD)方法通常计算成本过高,且难以保留时序动态,因为对基于图像方法的简单扩展通常会导致性能下降。在本文中,我们提出了一个新颖的单层级视频数据集蒸馏框架,该框架直接针对预训练模型优化合成视频。为了解决时序冗余并增强运动保留,我们引入了一种时序显著性引导的过滤机制,利用帧间差异来指导蒸馏过程,鼓励保留信息丰富的时序线索,同时抑制帧级冗余。在标准视频基准上的大量实验表明,我们的方法达到了最先进的性能,弥合了真实视频数据与蒸馏视频数据之间的差距,并为视频数据集压缩提供了一种可扩展的解决方案。

关键词

引用

@article{arxiv.2505.20694,
  title  = {Temporal Saliency-Guided Distillation: A Scalable Framework for Distilling Video Datasets},
  author = {Xulin Gu and Xinhao Zhong and Zhixing Wei and Yimin Zhou and Shuoyang Sun and Bin Chen and Hongpeng Wang and Yuan Luo},
  journal= {arXiv preprint arXiv:2505.20694},
  year   = {2025}
}