中文

将视频数据蒸馏为图像

计算机视觉与模式识别 2025-12-17 v1

摘要

数据蒸馏旨在合成紧凑且信息丰富的数据集,使在其上训练的模型能够实现与在完整数据集上训练相当的性能。虽然该方法已在图像数据方面显示出前景的成果,但将数据蒸馏方法扩展到视频数据仍具有挑战性,往往导致次优性能。本文首先识别了视频集合蒸馏的核心挑战,即由于视频时间维度引入的可学习参数的显著增加,这使得优化复杂化并阻碍收敛。为解决此问题,我们观察到单个帧往往足以捕获视频的判别性语义。利用这一洞察,我们提出单帧视频集合蒸馏(SFVD),该框架为每个类别的视频蒸馏为高度信息丰富的帧。通过可微分插值,这些帧被转换为视频序列并与原始数据集匹配,而更新受限于帧本身,以提高优化效率。为进一步融合时间信息,在匹配过程中将蒸馏帧与从真实视频中采样的真实视频组合,通过通道重塑层实现。广泛的实验在多个基准上表明,SFVD显著优于先前方法,在MiniUCF上实现最高可达5.3%的提升,为更有效的解决方案提供了可能。

关键词

引用

@article{arxiv.2512.14621,
  title  = {Distill Video Datasets into Images},
  author = {Zhenghao Zhao and Haoxuan Wang and Kai Wang and Yuzhang Shang and Yuan Hong and Yan Yan},
  journal= {arXiv preprint arXiv:2512.14621},
  year   = {2025}
}