自适应关键帧采样用于长视频理解
计算机视觉与模式识别
2025-03-03 v1 人工智能
机器学习
摘要
多模态大语言模型(MLLMs)通过将视觉输入作为额外的 token 注入大语言模型(LLM)的上下文中,实现了开放世界的视觉理解。然而,当视觉输入从单张图像变为长视频时,上述范式遇到了困难,因为大量的视频 token 显著超出了 MLLMs 的最大容量。因此,现有的基于视频的 MLLMs 主要建立在从输入数据中采样少量 token 的基础上,这可能导致关键信息丢失,从而产生错误的答案。本文提出了一种简单而有效的算法——自适应关键帧采样(AKS)。它插入了一个即插即用的模块——关键帧选择,旨在在固定数量的视频 token 下最大化有用信息。我们将关键帧选择形式化为一个优化问题,涉及(1)关键帧与提示之间的相关性,以及(2)关键帧对视频的覆盖度,并提出了一种自适应算法来逼近最优解。在两个长视频理解基准上的实验验证了自适应关键帧采样在选择信息丰富的关键帧后提升了视频问答准确率(超越了强基线)。本研究揭示了在基于视频的 MLLMs 中信息预筛选的重要性。代码可在 https://github.com/ncTimTang/AKS 获取。
引用
@article{arxiv.2502.21271,
title = {Adaptive Keyframe Sampling for Long Video Understanding},
author = {Xi Tang and Jihao Qiu and Lingxi Xie and Yunjie Tian and Jianbin Jiao and Qixiang Ye},
journal= {arXiv preprint arXiv:2502.21271},
year = {2025}
}
备注
CVPR2025