面向长视频理解的链式-shot 提示(CoS)
计算机视觉与模式识别
2025-02-12 v2
摘要
多模态大语言模型(MLLM)在处理长视频时因需要大量视觉 token 而受限,这些 token 大幅超出 MLLM 的上下文长度,导致被大量与任务无关的冗余镜头充满。如何选择镜头是未解决的关键问题:稀疏抽样风险漏掉关键细节,而穷举抽样则让模型被无关内容淹没,导致视频误解。为此,我们提出链式-shot 提示(CoS)。核心思想是将镜头选择建模为测试时视觉提示优化,通过优化镜头-任务对齐来选择适合视频理解语义任务的镜头。CoS 包含两个关键组成部分:(1)一种二值视频摘要机制,执行伪时间定位,发现二值编码以识别任务相关镜头;(2)一种视频共推理模块,部署二值编码,将任务相关的正镜头与无关的负镜头配对(学习对齐)。它将优化后的镜头选择嵌入原始视频中,促进关注相关上下文以优化长视频理解。实验在三个基准和五个数据集上表明,CoS 在有效性和适应性方面均取得佳绩。代码已提供于 https://lwpyh.github.io/CoS。
引用
@article{arxiv.2502.06428,
title = {CoS: Chain-of-Shot Prompting for Long Video Understanding},
author = {Jian Hu and Zixu Cheng and Chenyang Si and Wei Li and Shaogang Gong},
journal= {arXiv preprint arXiv:2502.06428},
year = {2025}
}
备注
A training-free test-time optimisation approach for long video understanding