Minerva-Ego:基于时空提示的自我姿态视频理解
计算机视觉与模式识别
2026-05-18 v1 机器学习
摘要
视频推理模型是自我姿态和具身智能体的核心组件。然而,现有基准仅评估输出(如问题答案),未评估中间推理步骤,大多数仅提供文本形式答案。我们引入 Minerva-Ego,一个用于评估复杂自我姿态视频推理的基准。我们扩展近期高质量的自我姿态/具身设置记录的数据源,添加一组具有挑战性的多步骤多模态问题和时空密集的人类标注推理痕迹。基准实验表明,最先进的模型仍与人类水平存在较大差距。为深入探讨这一差距,我们为数据集中的每个推理痕迹标注了解决问题所需的感兴趣对象,作为时空掩码标注。通过广泛的评估,我们确定,通过对 '何时何地' 进行提示的前沿模型可显著提升性能。Minerva-Ego 可在 https://github.com/google-deepmind/neptune 上下载。
引用
@article{arxiv.2605.15342,
title = {Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding},
author = {Arsha Nagrani and Jasper Uijilings and Shyamal Buch and Tobias Weyand and Sudheendra Vijayanarasimhan and Bo Hu and Ramin Mehran and David A Ross and Cordelia Schmid},
journal= {arXiv preprint arXiv:2605.15342},
year = {2026}
}