中文

Video-ToC:视频树状线索推理

计算机视觉与模式识别 2026-04-23 v1

摘要

现有视频大语言模型(Video LLM)在复杂视频理解方面存在推理能力有限且可能出现幻觉的问题。具体而言,这些方法倾向于仅依赖预训练的内在推理依据,缺乏对输入视频内容的感知导向适应。为此,我们提出了 Video-ToC,一种新的视频推理框架,通过树状线索推理增强视频理解。具体来说,我们的方法包含三个关键创新点:(1)基于树状结构的视觉线索局化机制,赋予模型通过结构化推理模式获得更细粒度的感知能力;(2)推理需求奖励机制,根据推理需求估计动态调整强化学习(RL)的奖励值,从而实现按需激励更有效的推理策略;(3)自动标注管道,用于构建 Video-ToC-SFT-1k 和 Video-ToC-RL-2k 数据集,分别用于监督微调(SFT)和 RL 训练。广泛的评估表明,Video-ToC 在六个视频理解基准和一个视频幻觉基准上均优于基线方法和近期方法。代码已公开于 https://github.com/qizhongtan/Video-ToC。

关键词

引用

@article{arxiv.2604.20473,
  title  = {Video-ToC: Video Tree-of-Cue Reasoning},
  author = {Qizhong Tan and Zhuotao Tian and Guangming Lu and Jun Yu and Wenjie Pei},
  journal= {arXiv preprint arXiv:2604.20473},
  year   = {2026}
}