中文

MaxInfo:基于最大体积的无训练关键帧选择方法以提升视频理解

计算机视觉与模式识别 2026-01-01 v3 机器学习

摘要

现代视频大语言模型(VLLMs)常采用均匀帧采样用于视频理解,但该方法常因帧冗余以及视频内容差异而难以捕获关键信息。我们提出了 MaxInfo,即首个基于最大体积原理的无训练方法,提供快速版、慢速版及基于块的版本,从视频中选择并保留最具代表性的帧。通过最大化所选嵌入所形成的几何体积,MaxInfo 确保所选帧覆盖嵌入空间中最具信息性的区域,有效减少冗余度同时保持多样性。该方法提高了输入表示的质量,并在多个基准测试中提升了长视频理解性能。例如,MaxInfo 在 LongVideoBench 上提升 3.28%,在 EgoSchema 上提升 6.4%。此外,MaxInfo 在 LLaVA-Video-72B 上将 LongVideoBench 性能提升 3.47%,在 MiniCPM4.5 上提升 3.44%。该方法实现简单,可与现有 VLLMs 无缝集成,无需额外训练且延迟极低,成为传统均匀采样方法的实用且高效的替代方案。我们的代码已公开于 https://github.com/FusionBrainLab/MaxInfo.git

关键词

引用

@article{arxiv.2502.03183,
  title  = {MaxInfo: A Training-Free Key-Frame Selection Method Using Maximum Volume for Enhanced Video Understanding},
  author = {Pengyi Li and Irina Abdullaeva and Alexander Gambashidze and Andrey Kuznetsov and Ivan Oseledets},
  journal= {arXiv preprint arXiv:2502.03183},
  year   = {2026}
}