EgoVITA:用于以太认知视频推理的规划与验证学习
计算机视觉与模式识别
2026-03-17 v2
摘要
以太认知视频理解需要在部分可见性和不断变化的视角下进行程序化推理。当前的多模态大语言模型(MLLM)在此设置下难以处理,常常生成在视觉上不一致或 grounding 较弱的响应。我们引入EgoVITA框架,将以太认知视频推理分解为结构化的plan-then-verify过程。模型首先生成以太认知计划:一个从第一人称视角预测的因果动作序列。该计划随后由以太认知验证阶段评估,该阶段从第三人称视角验证时空和逻辑一致性。该分解在无需配对ego-exo监督的情况下实现了跨视角反馈。为训练此推理过程,我们采用Group Relative Policy Optimization(GRPO),使用两个稠密奖励信号:一个将中间计划步骤与未来视觉状态对齐,另一个强化一致的第三人称验证。EgoVITA在以太认知基准测试中实现了最先进的性能,Qwen2.5-VL-7B性能提升了EgoBlind上的+7.7和EgoOrient上的+4.4,同时仅用47k训练样本在以太认知视频任务上保持强大的泛化能力。
引用
@article{arxiv.2511.18242,
title = {EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning},
author = {Yogesh Kulkarni and Pooyan Fazli},
journal= {arXiv preprint arXiv:2511.18242},
year = {2026}
}