中文

面向大型视觉语言模型的流式链律推理:Think-as-You-See范式

计算机视觉与模式识别 2026-03-09 v2

摘要

大型视觉语言模型(LVLMs)表现出强大的链律(Chain-of-Thought, CoT)能力,但大多数现有方法假设在推理前获得完整视频,属于批处理式流程,与实际视频流中信息顺序到达的情形不符。针对视频数据的流式特性,我们研究了LVLMs的两种流式推理范式。第一种是交错式范式,在接收帧和生成部分推理之间交替进行,但仍受限于严格的缓存更新顺序。为更好地匹配流式输入,我们提出了"思考即看见"(Think-as-You-See, TaYS)框架,实现真正的并行推理。TaYS集成了并行化CoT生成、流式约束训练和流式并行推理,进一步采用时间对齐的推理单元、流式注意力掩码和位置编码,以及解耦视觉编码与文本推理的双KV缓存。我们在Qwen2.5-VL系列模型上评估了所有范式,涵盖事件动态分析、因果推理和主题理解等代表性视频CoT任务。实验表明,TaYS在所有基线(包括批处理和交错式方法)中均表现出优异性能,在显著降低首词延迟(TTFT)和整体推理延迟的同时,实现了推理性能的提升。这些结果表明数据对齐的流式推理在启用LVLMs高效且响应迅速的视频理解方面具有重要作用。我们将发布代码至https://github.com/EIT-NLP/StreamingLLM/tree/main/TaYS。

关键词

引用

@article{arxiv.2603.02872,
  title  = {Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models},
  author = {Jialiang Zhang and Junlong Tong and Junyan Lin and Hao Wu and Yirong Sun and Yunpu Ma and Xiaoyu Shen},
  journal= {arXiv preprint arXiv:2603.02872},
  year   = {2026}
}