EOC-Bench:MLLMs 能否在自我中心世界中识别、回忆和预测物体?
计算机视觉与模式识别
2025-06-06 v1
摘要
多模态大语言模型 (MLLMs) 的兴起推动了自我中心视觉应用的突破。这些应用需要持续、上下文感知的物体理解,因为用户在动态且杂乱的环境中与工具交互。然而,现有的具身基准测试主要关注静态场景探索,强调物体的外观和空间属性,而忽视了对用户交互引起的动态变化的评估。为填补这一空白,我们引入 EOC-Bench,一个旨在系统评估动态自我中心场景中以物体为中心的具身认知的创新基准。具体而言,EOC-Bench 包含 3,277 个精心标注的问答对,分为三个时间类别:过去、现在和未来,涵盖 11 个细粒度评估维度和 3 种视觉物体引用类型。为确保全面评估,我们开发了包含四种问题类型的混合格式人机协作标注框架,并设计了一种新颖的多尺度时间精度度量用于开放式时间评估。基于 EOC-Bench,我们对各种专有、开源和物体级 MLLMs 进行了全面评估。EOC-Bench 是推进 MLLMs 具身物体认知能力的关键工具,为开发可靠的具身系统核心模型奠定了坚实基础。
引用
@article{arxiv.2506.05287,
title = {EOC-Bench: Can MLLMs Identify, Recall, and Forecast Objects in an Egocentric World?},
author = {Yuqian Yuan and Ronghao Dang and Long Li and Wentong Li and Dian Jiao and Xin Li and Deli Zhao and Fan Wang and Wenqiao Zhang and Jun Xiao and Yueting Zhuang},
journal= {arXiv preprint arXiv:2506.05287},
year = {2025}
}
备注
32pages