中文

Video-Skill-CoT:面向域自适应视频推理的基于技能的思维链

计算机视觉与模式识别 2025-10-27 v2 人工智能 计算与语言

摘要

近期思维链(CoT)推理的进展改善了复杂视频理解,但现有方法通常难以适应不同视频内容中的领域特定技能(如事件检测、空间关系理解、情感理解)。为解决这一问题,我们提出Video-Skill-CoT(简称Video-SKoT),一个自动构建并利用技能感知CoT监督进行域自适应视频推理的框架。首先,我们构建基于技能的CoT标注:从训练问题中提取领域相关的推理技能,将其聚类为共享技能体系结构,并为每个视频-问题对创建详细的多步CoT推理路径用于训练。其次,我们引入技能特定的专家学习框架。每个专家模块专注于一组推理技能的子集,并使用收集到的CoT监督通过轻量级适配器进行训练。我们在三个视频理解基准上验证了所提方法的有效性,Video-SKoT持续优于强基线。我们还提供了对不同CoT标注流水线和在多个视频领域中学习到的技能的深入分析。

关键词

引用

@article{arxiv.2506.03525,
  title  = {Video-Skill-CoT: Skill-based Chain-of-Thoughts for Domain-Adaptive Video Reasoning},
  author = {Daeun Lee and Jaehong Yoon and Jaemin Cho and Mohit Bansal},
  journal= {arXiv preprint arXiv:2506.03525},
  year   = {2025}
}

备注

Project website: https://video-skill-cot.github.io/