EgoExoBench:用于多模态大语言模型中第一人称和第三人称视角视频理解的基准
计算机视觉与模式识别
2025-07-25 v1
摘要
在第一人称 (镜像) 和第三人称 (外观) 视角之间传递和整合知识是人类智慧的内在特征,使人类能够从他人身上学习并传达自身经验的洞见。尽管多模态大语言模型 (MLLM) 在快速进步,但其在此类跨视角推理能力仍未得到探索。为此,我们引入 EgoExoBench,即用于镜像-外观视频理解与推理的第一个基准。基于公开数据集构建,EgoExoBench 包含超过 7300 组问答对,涵盖 11 个子任务,组织为三个核心挑战:语义对齐、视角关联和时间推理。我们评估了 13 个最先进的 MLLM,发现这些模型在单视角任务中表现出色,但在跨视角语义对齐、准确关联视角以及在镜像-外观语境下推断时间动态方面仍有挑战。我们希望 EgoExoBench 能为寻求类人跨视角智能的具身智能体和智能助手研究提供宝贵资源。
引用
@article{arxiv.2507.18342,
title = {EgoExoBench: A Benchmark for First- and Third-person View Video Understanding in MLLMs},
author = {Yuping He and Yifei Huang and Guo Chen and Baoqi Pei and Jilan Xu and Tong Lu and Jiangmiao Pang},
journal= {arXiv preprint arXiv:2507.18342},
year = {2025}
}