动态感知视频蒸馏:基于视频语义优化时间分辨率
计算机视觉与模式识别
2025-06-04 v1 人工智能
摘要
随着视觉任务的快速发展以及数据集和模型规模的扩大,视觉数据集中的冗余缩减已成为一个关键研究领域。为了解决这个问题,数据集蒸馏(DD)作为一种极具前景的方法应运而生,它生成高度紧凑且冗余显著减少的合成数据集,同时保留基本信息。然而,尽管 DD 在图像数据集上得到了广泛研究,视频数据集上的 DD 仍未得到充分探索。由于时间信息的存在以及不同类别之间冗余水平的差异,视频数据集带来了独特的挑战。现有的 DD 方法假设所有不同视频语义具有统一的时间冗余水平,这限制了它们在视频数据集上的有效性。在本工作中,我们提出了动态感知视频蒸馏(DAViD),一种用于预测合成视频最佳时间分辨率的强化学习(RL)方法。我们提出了一种带有教师循环的奖励函数来更新 RL 智能体策略。据我们所知,这是首次在视频数据集蒸馏中引入基于视频语义的自适应时间分辨率的研究。我们的方法显著优于现有的 DD 方法,展现出实质性的性能提升。这项工作为未来更高效、语义自适应的视频数据集蒸馏研究铺平了道路。
引用
@article{arxiv.2506.02021,
title = {Dynamic-Aware Video Distillation: Optimizing Temporal Resolution Based on Video Semantics},
author = {Yinjie Zhao and Heng Zhao and Bihan Wen and Yew-Soon Ong and Joey Tianyi Zhou},
journal= {arXiv preprint arXiv:2506.02021},
year = {2025}
}