Act2See:用于视频推理的主动视觉感知
计算机视觉与模式识别
2026-05-05 v1
摘要
视觉-语言模型(VLMs)通常依赖静态初始帧进行视频推理,限制了其在推理过程演进时纳入必需动态信息的能力。现有方法通过增加额外帧信息来增强链式思考(CoT),往往表现不佳且缺乏对假设或反事实情景的视觉信息合成能力。我们提出Act-to-See(Act2See),一个新框架,使VLMs能够通过在文本 CoT 中交错插入视频帧,实现主动视觉感知。Act2See通过在由前沿VLm生成的高质量推理痕迹数据集上进行监督微调实现,这些痕迹集成对现有帧的检索调用或新帧的生成调用,并严格验证于人工标注的 CoT 以确保质量。该方法在推理时培育出一种新兴能力:模型主动确定何时搜索或合成必要的视觉证据。Act2See在VideoEspresso和ViTIB等具有挑战性的基准测试上实现了新的状态-of-the-art 成绩,并在Video-MME、EgoNormia和VCR-Bench上超越了可比或更大模型,推动了VLMs在视频推理中实现主动视觉感知。
引用
@article{arxiv.2605.01657,
title = {Act2See: Emergent Active Visual Perception for Video Reasoning},
author = {Martin Q. Ma and Yuxiao Qu and Aditya Agrawal and Willis Guo and Paul Pu Liang and Ruslan Salakhutdinov and Louis-Philippe Morency},
journal= {arXiv preprint arXiv:2605.01657},
year = {2026}
}
备注
CVPR 2026