中文

TIR-Flow:基于冻结视频语言模型的主动视频搜索与推理

计算机视觉与模式识别 2026-01-13 v1

摘要

尽管大型视频语言模型(Video-LLM)在感知方面取得了显著进展,但其推理能力仍然是制约瓶颈。现有方法通常采用重型的数据工程范式——综合大规模链式思考(Chain-of-Thought, CoT)数据集后进行监督微调(SFT)和强化学习(RL)。该流程主要优化概率采样效率并对输出分布进行对齐,但未能激发动态视觉探索所需的内在智能。本文提出TIR-Flow,一种一种新框架,使其从被动处理范式转向主动视频搜索与推理,且无需额外数据或参数更新。具体而言,本框架通过三个协同模块实现:HDD将复杂查询分解为一组可验证子任务;HAP主动引导视觉注意力以收集假设验证的高分辨率证据;EBA维持持久工作空间以累积和更新发现的线索以进行逻辑推理。对七个基准进行的广泛实验表明,TIR-Flow显著优于最近的强大基线,平均性能提升5.9%,在Egoschema上提升可达10.5%。我们的分析确认,赋予冻结VLMS以类System-2主动感知是解决长期视频推理的可扩展路径。

关键词

引用

@article{arxiv.2601.06176,
  title  = {TIR-Flow: Active Video Search and Reasoning with Frozen VLMs},
  author = {Hongbo Jin and Siyi Xie and Jiayu Ding and Kuanwei Lin and Ge Li},
  journal= {arXiv preprint arXiv:2601.06176},
  year   = {2026}
}