中文

QuoTA: 基于 CoT 查询解耦的查询导向标记分配,用于长视频理解

计算机视觉与模式识别 2025-03-12 v1

摘要

近期长视频理解的进展通常通过基于注意力分布的视觉标记修剪来缓解视觉冗余。然而,现有方法在解码器层中采用事后低响应标记修剪,忽略了视觉标记与指令(查询)之间输入层的语义关联。在本文中,我们提出 QuoTA,这是一种 ante-hoc 训练-free 的模块化方法,通过查询导向的帧级重要性评估来扩展现有的大型视频语言模型(LVLMs)进行视觉标记分配。查询导向的标记选择至关重要,因为它将视觉处理与任务特定需求对齐,优化标记预算的使用,同时保留语义相关内容。具体而言,(1)QuoTA 基于查询相关性战略分配帧级重要性得分,在解码器层的跨模态交互之前进行一次性视觉标记分配;(2)我们通过链式思维(Chain-of-Thoughts)推理解耦查询,以促进更精确的 LVLM-based 桢级重要性评分;(3)QuoTA 提供可即插即用的功能,可扩展到现有的 LVLMs。大量实验结果表明,使用 QuoTA 与 LLaVA-Video-7B 集成可实现 6 个基准测试(包括 Video-MME 和 MLVU)平均提升 3.2%,且在相同的视觉标记预算下与基线相当。代码已开源于 https://github.com/MAC-AutoML/QuoTA

关键词

引用

@article{arxiv.2503.08689,
  title  = {QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension},
  author = {Yongdong Luo and Wang Chen and Xiawu Zheng and Weizhong Huang and Shukang Yin and Haojia Lin and Chaoyou Fu and Jinfa Huang and Jiayi Ji and Jiebo Luo and Rongrong Ji},
  journal= {arXiv preprint arXiv:2503.08689},
  year   = {2025}
}

备注

Project page: https://github.com/MAC-AutoML/QuoTA