中文

视频集蒸馏:信息多样化与时序稠密化

计算机视觉与模式识别 2024-12-03 v1

摘要

人工智能模型的快速发展导致越来越多的人关注增强其处理复杂输入数据(如视频)的能力。尽管已引入大规模视频数据集以支持这一发展,但针对视频集降低冗余度的独特挑战尚未被探索。与图像数据集或单个视频不同,视频集具有两层嵌套结构:外层是单个视频的集合,内层包含帧级数据点之间的相关性以提供时序信息。视频集存在两个维度的冗余:样本内冗余和样本间冗余。现有方法(如关键帧选择、数据集修剪或数据集蒸馏)未能针对视频集的独特挑战进行处理,因为它们旨在减少单一维度上的冗余。本文首次研究视频集蒸馈,通过联合处理样本内和样本间冗余来合成优化视频数据。我们的信息多样化与时序稠密化(IDTD)方法通过特征池和特征选择器机制保留样本间的多样性,同时通过时序融合器维持合成视频中时序信息的稠密性。该方法在视频数据集蒸馈中实现了最先进的效果,为更有效的冗余减少和高效 AI 模型训练铺路。

关键词

引用

@article{arxiv.2412.00111,
  title  = {Video Set Distillation: Information Diversification and Temporal Densification},
  author = {Yinjie Zhao and Heng Zhao and Bihan Wen and Yew-Soon Ong and Joey Tianyi Zhou},
  journal= {arXiv preprint arXiv:2412.00111},
  year   = {2024}
}