中文

VideoCompressa: 基于联合时空压缩和空间重构的数据高效视频理解

计算机视觉与模式识别 2025-11-25 v1

摘要

视频理解模型的可扩展性正受限于大规模视频数据集的存储和计算成本的制约。虽然数据合成在图像领域提高了数据效率,但其在视频领域的扩展仍具有挑战,due to pervasive temporal redundancy and complex spatiotemporal dynamics。 In this work, we uncover a critical insight: the primary source of inefficiency in video datasets is not inter-sample redundancy, but intra-sample frame-level redundancy. 为了利用这一洞见,我们引入VideoCompressa,一个新的视频数据合成框架,将问题重新表述为动态潜在压缩。具体而言,VideoCompressa联合优化一个可微的关键帧选择器(作为轻量级ConvNet)通过Gumbel-Softmax采样来识别最具信息性的帧,以及一个预训练、冻结的变分自编码器(VAE)将这些帧压缩到紧凑、富有语义的潜在代码中。这些潜在表示然后输入到压缩网络中,实现端到端反向传播。关键的是,关键帧选择器和合成潜在代码共同优化,以最大化保留任务相关信息。实验表明,我们的方法在数据效率方面实现了前所未有的水平:在ConvNets上使用UCF101,VideoCompressa仅使用原始数据的0.13%即超过了全数据训练高出2.34个百分点,相对于传统合成方法拥有超过5800倍的加速。此外,在对HMDB51上微调Qwen2.5-7B-VL时,VideoCompressa仅使用训练数据的0.41%即可匹配全数据性能——超过零样本基线10.61个百分点。

关键词

引用

@article{arxiv.2511.18831,
  title  = {VideoCompressa: Data-Efficient Video Understanding via Joint Temporal Compression and Spatial Reconstruction},
  author = {Shaobo Wang and Tianle Niu and Runkang Yang and Deshan Liu and Xu He and Zichen Wen and Conghui He and Xuming Hu and Linfeng Zhang},
  journal= {arXiv preprint arXiv:2511.18831},
  year   = {2025}
}

备注

15 pages, 6 tables, 8 figures