中文

视频动作数据集压缩的大规模研究

计算机视觉与模式识别 2025-03-13 v2

摘要

最近,数据集压缩在图像领域取得了显著进展。与图像不同,视频拥有额外的时序维度,这蕴含着相当大的冗余信息,使得压缩变得更加关键。然而,视频数据集压缩仍是一个鲜有人关注的领域。我们通过提供大规模研究并进行系统设计和公平比较来弥合这一差距。具体而言,我们的工作深入研究了三个关键方面,以提供有价值的经验见解:(1) 视频数据的时序处理,(2) 视频数据集压缩的评估协议,(3) 将压缩算法适应时空领域。从本研究中,我们得出了几个有趣的观察:(i) 标记方法显著影响压缩性能,(ii) 简单的滑动窗口采样在时序处理方面效果良好,(iii) 数据集提炼方法在挑战性场景中表现更好,而样本选择方法在更容易的场景中更出色。此外,我们提出了一种统一的评估协议,用于公平比较不同压缩算法,并在四个广泛使用的动作识别数据集 HMDB51、UCF101、SSv2 和 K400 上实现了最先进的结果。我们的代码可在 https://github.com/MCG-NJU/Video-DC 获取。

关键词

引用

@article{arxiv.2412.21197,
  title  = {A Large-Scale Study on Video Action Dataset Condensation},
  author = {Yang Chen and Sheng Guo and Bo Zheng and Limin Wang},
  journal= {arXiv preprint arXiv:2412.21197},
  year   = {2025}
}