中文

KeyVideoLLM: 面向大规模视频关键帧选择的 метод

计算机视觉与模式识别 2024-08-13 v3 计算与语言 多媒体

摘要

近年来,随着网络视频的兴起,管理和理解大规模视频数据集日益重要。视频大语言模型(VideoLLM)因其强大的视频理解能力而近年来涌现。然而,VideoLLM 的训练和推理过程需要巨大的数据量,这对数据管理提出了效率、鲁棒性和有效性方面的重大挑战。本文提出了 KeyVideoLLM,一种基于文本-视频帧相似性的关键帧选择方法,用于高效、稳健和有效地管理 VideoLLM 数据。具体而言,KeyVideoLLM 实现了最高可达 60.9 倍的数据压缩率,显著降低了磁盘空间需求,证明其高效性。此外,它在所有视频格式和规模上保持 100% 的选择成功率,将处理速度提升了最高可达 200 倍(较于现有关键帧选择方法),且无需调参。除了卓越的效率和鲁棒性外,KeyVideoLLM 还在训练和推理阶段提升了视频问答任务中的模型性能。值得注意的是,它在多样化数据集上始终实现了最先进(SOTA)实验结果。

关键词

引用

@article{arxiv.2407.03104,
  title  = {KeyVideoLLM: Towards Large-scale Video Keyframe Selection},
  author = {Hao Liang and Jiapeng Li and Tianyi Bai and Xijie Huang and Linzhuang Sun and Zhengren Wang and Conghui He and Bin Cui and Chong Chen and Wentao Zhang},
  journal= {arXiv preprint arXiv:2407.03104},
  year   = {2024}
}