PRISM:基于稀疏运动渐进细化与插入的视频数据集凝缩
计算机视觉与模式识别
2026-03-25 v2 人工智能
机器学习
摘要
视频数据集凝缩旨在降低视频处理的巨大计算成本。然而,它面临着空间外观与时间动力学之间不可分割的相互依赖这一根本挑战。先前的工作遵循静态/动态解耦范式,将视频分解为静态内容和辅助运动信号。这种多阶段方法常常误表示了真实世界动作的内在耦合。我们引入了稀疏运动渐进细化与插入(PRISM),这是一种整体方法,从一开始就将视频视为统一且完全耦合的时空结构。为了最大化表征效率,PRISM 通过避免固定帧优化来解决视频固有的时间冗余。它从最小的时间锚点开始,仅在线性插值无法捕捉非线性动态时逐步插入关键帧。这些关键时刻通过梯度错位来识别。这种自适应过程确保了表征容量被精确分配到所需之处,在保留复杂运动的同时最小化存储需求。大量实验表明,PRISM 在标准基准测试上取得了具有竞争力的性能,同时通过其稀疏且整体学习的表征提供了 SOTA 的存储效率。
引用
@article{arxiv.2505.22564,
title = {PRISM: Video Dataset Condensation with Progressive Refinement and Insertion for Sparse Motion},
author = {Jaehyun Choi and Jiwan Hur and Gyojin Han and Jaemyung Yu and Junmo Kim},
journal= {arXiv preprint arXiv:2505.22564},
year = {2026}
}
备注
CVPR 2026