视频中的任意对象描述:基于时空多模态提示的细粒度以对象为中心的视频描述
计算机视觉与模式识别
2025-04-10 v2
摘要
我们提出了CAT-V(Caption AnyThing in Video),一个用于细粒度以对象为中心的视频描述的免训练框架,可通过时间对用户选定对象进行详细描述。CAT-V集成了三个关键组件:基于SAMURAI的分割器,用于跨帧精确的对象分割;由TRACE-Uni驱动的时间分析器,用于准确的事件边界检测和时间分析;以及使用InternVL-2.5的描述器,用于生成详细的以对象为中心的描述。通过时空视觉提示和链式推理,我们的框架生成了详细的、时间感知的描述,涵盖对象的属性、动作、状态、交互和环境背景,而无需额外的训练数据。CAT-V通过多种视觉提示(点、边界框和不规则区域)支持灵活的用户交互,并通过追踪不同时间段中对象的状态和交互来保持时间敏感性。我们的方法解决了现有视频描述方法的局限性,这些方法要么产生过于抽象的描述,要么缺乏对象级别的精度,从而实现细粒度的、以对象特定的描述,同时保持时间一致性和空间准确性。该项目的GitHub仓库地址为 https://github.com/yunlong10/CAT-V
引用
@article{arxiv.2504.05541,
title = {Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting},
author = {Yunlong Tang and Jing Bi and Chao Huang and Susan Liang and Daiki Shimada and Hang Hua and Yunzhong Xiao and Yizhi Song and Pinxin Liu and Mingqian Feng and Junjia Guo and Zhuo Liu and Luchuan Song and Ali Vosoughi and Jinxi He and Liu He and Zeliang Zhang and Jiebo Luo and Chenliang Xu},
journal= {arXiv preprint arXiv:2504.05541},
year = {2025}
}