CoTasks:基于思维链的视频指令微调任务
计算机视觉与模式识别
2025-07-21 v1 计算与语言
摘要
尽管视频大语言模型(VideoLLMs)近期取得了进展,一个关键的开放挑战仍然存在:如何使模型具备基于细粒度对象级视频理解的思维链(CoT)推理能力。现有的指令微调模型,如Qwen和LLaVA系列,是在高层级的视频-文本对上训练的,通常缺乏组合式、逐步推理所需的结构化标注。我们提出CoTasks:基于思维链的视频指令微调任务,这是一个新框架,它将现有数据集(例如NeXT-QA、STAR)中的复杂视频问题分解为四个实体级基础任务:帧定位、实体跟踪、空间关系提取和时间关系提取。通过将这些中间CoT风格的推理步骤嵌入输入,CoTasks使模型能够显式地执行以对象为中心的时空推理。在NeXT-QA基准上的实验表明,CoTasks显著提升了推理性能:LLaVA-video-7B的平均GPT-4评估得分提高了+3.3分,Qwen2.5-VL-3B提高了+17.4分,在因果(+14.6)、时间(+10.9)和描述性(+48.1)子类别中均有大幅提升。这些结果证明了CoTasks作为一种结构化CoT风格监督框架在改进组合式视频推理方面的有效性。
引用
@article{arxiv.2507.13609,
title = {CoTasks: Chain-of-Thought based Video Instruction Tuning Tasks},
author = {Yanan Wang and Julio Vizcarra and Zhi Li and Hao Niu and Mori Kurokawa},
journal= {arXiv preprint arXiv:2507.13609},
year = {2025}
}