VideoAuto-R1:基于一次思考、两次回答的视频自动推理
计算机视觉与模式识别
2026-03-24 v2
摘要
思维链推理已成为多模态大语言模型在视频理解任务中的强大工具。然而,其必要性以及相较于直接回答的优势仍未得到充分探索。在本文中,我们首先证明,对于经强化学习训练的视频模型,直接回答的性能通常与 CoT 相当甚至更优,尽管 CoT 以更高的计算成本生成了逐步分析。受此启发,我们提出了 VideoAuto-R1,一个采用“必要时推理”策略的视频理解框架。在训练期间,我们的方法遵循“一次思考,两次回答”范式:模型首先生成初始答案,然后执行推理,最后输出经审查的答案。两个答案均通过可验证奖励进行监督。在推理期间,模型利用初始答案的置信度得分来决定是否继续进行推理。在多个视频问答与定位基准上,VideoAuto-R1 实现了 SOTA 准确率且效率显著提升,将平均响应长度缩减约 3.3 倍,例如从 149 个 token 减少至仅 44 个 token。此外,我们观察到在面向感知的任务中思维模式激活率较低,而在推理密集型任务中激活率较高。这表明,基于语言的显式推理通常是有益的,但并非总是必要的。
引用
@article{arxiv.2601.05175,
title = {VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice},
author = {Shuming Liu and Mingchen Zhuge and Changsheng Zhao and Jun Chen and Lemeng Wu and Zechun Liu and Chenchen Zhu and Zhipeng Cai and Chong Zhou and Haozhe Liu and Ernie Chang and Saksham Suri and Hongyu Xu and Qi Qian and Wei Wen and Balakrishnan Varadarajan and Zhuang Liu and Hu Xu and Florian Bordes and Raghuraman Krishnamoorthi and Bernard Ghanem and Vikas Chandra and Yunyang Xiong},
journal= {arXiv preprint arXiv:2601.05175},
year = {2026}
}
备注
Accepted to CVPR 2026. Project page: https://ivul-kaust.github.io/projects/videoauto-r1/