中文

视频链条推理的再思考

计算机视觉与模式识别 2025-12-11 v1 人工智能 计算与语言 机器学习

摘要

链条推理 (CoT) 在自然语言处理中取得了巨大成功,近期的多模态大语言模型 (MLLM) 将这一范式扩展到视频推理。然而,这些模型通常依赖冗长的推理链和大量输入视觉标记。基于我们基准研究的经验观察,我们假设简洁的推理结合减少的视觉标记对有效视频推理足以。为评估此假设,我们设计并验证了一个高效的后训练和推理框架,增强视频 MLLM 的推理能力。我们的框架使模型能够在压缩视觉标记上 operate,并在作答前生成简短的推理痕迹。所得模型在推理效率方面显著提升,跨 diverse benchmark 实现竞争性能,无需依赖手动 CoT 注释或监督微调。总体而言,我们的结果表明,长而类人式的 CoT 推理可能对通用视频推理并非必需,简洁推理既有效又高效。我们的代码将发布于 https://github.com/LaVi-Lab/Rethink_CoT_Video。

关键词

引用

@article{arxiv.2512.09616,
  title  = {Rethinking Chain-of-Thought Reasoning for Videos},
  author = {Yiwu Zhong and Zi-Yuan Hu and Yin Li and Liwei Wang},
  journal= {arXiv preprint arXiv:2512.09616},
  year   = {2025}
}

备注

Technical report