中文

GVD:用于可扩展视频蒸馏的引导视频扩散模型

计算机视觉与模式识别 2025-07-31 v1 人工智能

摘要

为解决大型视频数据集相关的计算和存储需求,视频数据蒸馏旨在捕捉空间和时间信息,以显著 smaller 的数据集表示训练在蒸馈数据上的训练性能相当于在所有数据上。我们提出了 GVD:引导视频扩散,这是首个基于扩散的方法进行视频蒸馈。GVD 联合蒸馈空间和时间特征,确保在捕捉 diverse actions 的同时实现高保真视频生成,同时捕捉关键运动信息。我们的方法的 diverse 但具代表性的蒸馈在 MiniUCF 和 HMDB51 数据集上在 5、10 和 20 Instances Per Class (IPC) 上显著优于前沿方法。具体而言,我们的方法仅使用 MiniUCF 数据集中 1.98% 的总帧数即可达到原始数据集性能的 78.29%。此外,在 HMDB51 上仅使用 3.30% 的帧数即可达到 73.83% 的性能。实验结果表明,GVD 不仅实现了最先进的性能,还能生成更高分辨率的视频和更高的 IPC,而不会显著增加计算成本。

关键词

引用

@article{arxiv.2507.22360,
  title  = {GVD: Guiding Video Diffusion Model for Scalable Video Distillation},
  author = {Kunyang Li and Jeffrey A Chan Santiago and Sarinda Dhanesh Samarasinghe and Gaowen Liu and Mubarak Shah},
  journal= {arXiv preprint arXiv:2507.22360},
  year   = {2025}
}