中文

FiLA-Video:面向细粒度长视频理解的时空压缩

计算机视觉与模式识别 2025-04-30 v1

摘要

近期视觉大语言模型(VLLM)在视频理解方面取得了显著进展。然而,视频数据的复杂性以及上下文处理的局限性仍阻碍了长视频理解。常见的做法是对视频特征进行压缩,以减少输入至大语言模型的 token 数量,但许多方法要么未优先考虑关键特征,导致帧间冗余信息增加,要么引入计算密集型模块。为此,我们提出了 FiLA(Fine-grained Vision Language Model)-Video 框架,采用轻量级动态加权多帧融合策略,自适应地将多个帧整合为单个表示,同时保留关键视频信息并降低计算成本。为增强帧选择的融合效果,我们引入关键帧选择策略,有效从大量帧中识别信息丰富的帧,以实现更好的摘要。此外,我们提出一种简单且高效的长视频训练数据生成策略,无需大量人工标注即可提升模型性能。实验结果表明,FiLA-Video 在长视频理解中实现了优异的效率和准确率,优于现有方法。

关键词

引用

@article{arxiv.2504.20384,
  title  = {FiLA-Video: Spatio-Temporal Compression for Fine-Grained Long Video Understanding},
  author = {Yanan Guo and Wenhui Dong and Jun Song and Shiding Zhu and Xuan Zhang and Hanqing Yang and Yingbo Wang and Yang Du and Xianing Chen and Bo Zheng},
  journal= {arXiv preprint arXiv:2504.20384},
  year   = {2025}
}

备注

8 pages, 6 figures