稀疏视频理解与推理
计算机视觉与模式识别
2026-02-17 v1 机器学习
摘要
我们提出了\revise(\underline{Re}asoning with \underline{Vi}deio \underline{S}parsity),一个用于视频问答(VQA)的多轮智能体。与其均匀抽取帧,不如\revise 选择一小组有信息量的帧,跨轮维持一种状态总结,并在确信时提前停止。它支持专有的视觉语言模型(VLMs)实现即插即用,并为开源模型提供强化微调支持。对于微调,我们引入EAGER(Evidence-Adjusted Gain for Efficient Reasoning),这是一种无需标注的奖励函数,包含三个组成部分:(1)置信度提升:在新增帧后,我们奖励正确选项与最强备选答案之间对数几率差的增加;(2)摘要充分性:在答题时我们仅使用最后提交的摘要重新提问,并奖励成功;(3)正确且及时停止:在有限的轮数内正确答题将获得奖励。跨多个VQA基准,\revise在减少帧数、轮数和提示标记的同时提升了准确率,展示了实用的稀疏视频推理。
引用
@article{arxiv.2602.13602,
title = {Towards Sparse Video Understanding and Reasoning},
author = {Chenwei Xu and Zhen Ye and Shang Wu and Weijian Li and Zihan Wang and Zhuofan Xia and Lie Lu and Pranav Maneriker and Fan Du and Manling Li and Han Liu},
journal= {arXiv preprint arXiv:2602.13602},
year = {2026}
}