EgoVLM:面向第一人称视角视频理解的策略优化
计算机视觉与模式识别
2025-06-04 v1 人工智能
摘要
新兴的具身 AI 应用(如可穿戴摄像头和自主智能体)凸显了从第一人称视频流中进行鲁棒推理的需求。我们引入了 EgoVLM,这是一种专门设计用于在第一人称视角视频语境中整合视觉理解与时空推理的视觉语言模型。EgoVLM 通过 Group Relative Policy Optimization (GRPO) 进行微调,这是一种经过调整以将模型输出与类人推理步骤对齐的强化学习方法。遵循 DeepSeek R1-Zero 的方法,我们直接使用 RL 进行微调,而没有在思维链(CoT)数据上进行任何监督微调阶段。我们在第一人称视角视频问答基准上评估了 EgoVLM,并表明特定领域的训练显著提升了其相对于通用 VLMs 的性能。我们的 EgoVLM-3B 仅在非 CoT 第一人称视角数据上训练,在 EgoSchema 基准上分别比基础 Qwen2.5-VL 3B 和 7B 模型高出 14.33 和 13.87 个准确率点。通过显式生成推理轨迹,EgoVLM 增强了可解释性,使其非常适合下游应用。此外,我们引入了一种新颖的基于关键帧的奖励,该奖励结合了显著帧选择以指导强化学习优化。这种奖励公式化为时间定位的第一人称视角推理的未来探索开辟了有前景的途径。
引用
@article{arxiv.2506.03097,
title = {EgoVLM: Policy Optimization for Egocentric Video Understanding},
author = {Ashwin Vinod and Shrey Pandit and Aditya Vavre and Linshen Liu},
journal= {arXiv preprint arXiv:2506.03097},
year = {2025}
}
备注
Our Code can be found at https://github.com/adityavavre/VidEgoVLM