中文

DynFocus:动态协作网络赋能 LLM 视频理解

计算机视觉与模式识别 2025-03-26 v2

摘要

基于 LLM 的视频理解面临的挑战在于,在保持内存可承受的 token 数量的同时,保留长视频中的视觉和语义信息。然而,视频中的冗余和对应关系阻碍了现有方法的性能潜力。通过对当前数据集进行统计学习,我们观察到冗余出现在重复帧和与答案无关的帧中,且对应的帧随不同问题而变化。这表明可以采用动态编码来平衡详细的视频信息保留与 token 预算缩减。为此,本文提出了一种动态协作网络 DynFocus,用于内存高效的视频编码。具体而言,i) 动态事件原型估计(DPE)模块,用于动态选择对回答问题有意义的帧;ii) 紧凑协作编码(CCE)模块,分别对有意义的帧进行详细视觉外观编码,对剩余帧进行粗略感知编码。我们在五个公开基准上评估了我们的方法,实验结果一致表明我们的方法取得了具有竞争力的性能。

关键词

引用

@article{arxiv.2411.12355,
  title  = {DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding},
  author = {Yudong Han and Qingpei Guo and Liyuan Pan and Liu Liu and Yu Guan and Ming Yang},
  journal= {arXiv preprint arXiv:2411.12355},
  year   = {2025}
}

备注

Accepted by CVPR 25