视频推理模型是否准备好在实际场景中应用了?
计算机视觉与模式识别
2026-04-15 v2 人工智能
摘要
在实际部署中,视觉语言模型常常遇到如天气、遮挡和相机运动等干扰。在此类条件下,他们的理解与推理能力会显著下降,暴露出与干净、受控(即无扰动)评估环境之间的差距。为此,我们提出了 ROVA,一种新颖的训练框架,通过建模鲁棒性感知的一致性奖励来提高鲁棒性。ROVA 引入难度感知的在线训练策略,基于模型不断演化的能力对样本进行难度排序。具体而言,它持续通过自反省评估重新估计样本难度,从而实现鲁棒性感知的一致性奖励驱动的自适应训练。我们还引入了 PVRBench,这是一个新基准,注入真实世界扰动到具身视频数据集中,以评估在真实扰动下的准确性和推理质量。我们在 PVRBench、UrbanVideo 和 VisBench 上评估了 ROVA 和基线模型,其中一些开源和专有模型在真实扰动下的准确性和推理能力分别下降最高可达35%和28%。ROVA 有效缓解了性能下降,使相对准确性提升至少24%,推理能力提升超过9%。这些收益也传递到干净标准基准上,实现持续的改进。
引用
@article{arxiv.2603.10652,
title = {Are Video Reasoning Models Ready to Go Outside?},
author = {Yangfan He and Changgyu Boo and Jaehong Yoon},
journal= {arXiv preprint arXiv:2603.10652},
year = {2026}
}
备注
Project Page: https://robust-video-reason.github.io/