IQViC: 面向长期视频理解的基于问题自适应的视觉压缩器
计算机视觉与模式识别
2024-12-17 v2
摘要
随着视频数据复杂度的增加以及对更高效长期时序理解的需求,现有长期视频理解方法往往难以准确捕获和分析扩展视频序列。这些方法通常在更长的持续时间上难以保持性能,并难以处理视频内容中复杂的依赖关系。为此,我们提出一种简单而有效的大型多模态模型框架,用于长期视频理解,包含一种新型视觉压缩器,即问题自适应视觉压缩器(In-context, Question Adaptive Visual Compressor, IQViC)。我们的核心思想灵感来源于人类选择性注意和情境记忆机制,引入了新的视觉压缩器并纳入高效的记忆管理技术,以增强长期视频问答。我们的框架利用IQViC——一种基于Transformer的视觉压缩器,实现问题条件化的情境压缩,不同于依赖完整视频视觉特征的现有方法。这一方法有助于有针对性地提取相关信息,显著降低内存token需求。通过在基于InfiniBench用于长期视频理解的新数据集上进行大量实验,以及用于评估现有方法的标准基准测试,我们展示了我们提出的IQViC框架的有效性以及其在视频理解准确性和内存效率方面优于当前最先进方法的优势。
引用
@article{arxiv.2412.09907,
title = {IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs},
author = {Sosuke Yamao and Natsuki Miyahara and Yuki Harazono and Shun Takeuchi},
journal= {arXiv preprint arXiv:2412.09907},
year = {2024}
}
备注
The first and second authors contributed equally to this work