DynFocus:动态协作网络赋能 LLM 视频理解
计算机视觉与模式识别
2025-03-26 v2
摘要
基于 LLM 的视频理解面临的挑战在于,在保持内存可承受的 token 数量的同时,保留长视频中的视觉和语义信息。然而,视频中的冗余和对应关系阻碍了现有方法的性能潜力。通过对当前数据集进行统计学习,我们观察到冗余出现在重复帧和与答案无关的帧中,且对应的帧随不同问题而变化。这表明可以采用动态编码来平衡详细的视频信息保留与 token 预算缩减。为此,本文提出了一种动态协作网络 DynFocus,用于内存高效的视频编码。具体而言,i) 动态事件原型估计(DPE)模块,用于动态选择对回答问题有意义的帧;ii) 紧凑协作编码(CCE)模块,分别对有意义的帧进行详细视觉外观编码,对剩余帧进行粗略感知编码。我们在五个公开基准上评估了我们的方法,实验结果一致表明我们的方法取得了具有竞争力的性能。
引用
@article{arxiv.2411.12355,
title = {DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding},
author = {Yudong Han and Qingpei Guo and Liyuan Pan and Liu Liu and Yu Guan and Ming Yang},
journal= {arXiv preprint arXiv:2411.12355},
year = {2025}
}
备注
Accepted by CVPR 25