中文

IntentVCNet:构建意图导向可控视频描述中的时空间隙

计算机视觉与模式识别 2025-07-25 v1

摘要

意图导向控制视频描述旨在基于用户自定义意图为视频中的特定目标生成目标描述。当前的大规模视觉语言模型(LVLMs)已展现出强大的指令遵循和视觉理解能力。尽管 LVLMs 在空间和时间理解方面各自表现突出,但无法直接针对指令实现细粒度的时空控制。这种显著的时空差距使实现意图导向的细粒度控制变得复杂。为此,我们提出一种新的 IntentVCNet,通过统一 LVLMs 中内在的时空理解知识,从提示和模型两个角度桥接时空差距。具体而言,我们首先提出一种提示组合策略,旨在使 LLM 能够建模描述用户意图和视频序列之间隐含关系的提示。随后,我们提出一种参数高效的盒子适配器,增强全局视觉上下文中对象的语义信息,以便视觉标记预先获取用户意图的信息。最终的实验表明,这两种策略的结合进一步提升了 LVLMs 对视频序列中空间细节的建模能力,并促进 LVLMs 准确生成受控的意图导向描述。我们的方法在多个开源 LVLMs 上实现了最好的结果,并在 IntentVC 挑战中获得亚冠。我们的代码已公开于 https://github.com/thqiu0419/IntentVCNet。

关键词

引用

@article{arxiv.2507.18531,
  title  = {IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning},
  author = {Tianheng Qiu and Jingchun Gao and Jingyu Li and Huiyi Leong and Xuan Huang and Xi Wang and Xiaocheng Zhang and Kele Xu and Lan Zhang},
  journal= {arXiv preprint arXiv:2507.18531},
  year   = {2025}
}