中文

ECBench:多模态基础模型能否理解以太ocentric视角?全方位具身认知基准

计算机视觉与模式识别 2025-03-14 v2 机器学习 机器人学

摘要

大型视觉语言模型(LVM)正在显著提升机器人在 generalization 方面的能力。因此,基于以太ocentric视频的LVM具身认知能力备受关注。然而,当前用于具身视频问答的数据集缺乏全面且系统的评估框架。关键的具身认知问题,如机器人自我认知、动态场景感知和幻觉,极少被系统性地评估。为此,我们提出了ECBench,一个高质量的基准,旨在系统评估LVM的具身认知能力。ECBench涵盖多样化的场景视频来源、开放且多变的问答格式,以及30个具身认知维度。为确保质量、平衡和高度视觉依赖性,ECBench采用类别独立的严谨的人类标注和多轮问答筛选策略。此外,我们引入ECEval,一个全面的评估系统,确保指标的公平性和合理性。利用ECBench,我们对专有、开源和任务特定的LVM进行了广泛评估。ECBench在推动LVM具身认知能力方面发挥了关键作用,为开发可靠的具身智能体核心模型奠定了坚实基础。所有数据和代码均可在https://github.com/Rh-Dang/ECBench获取。

关键词

引用

@article{arxiv.2501.05031,
  title  = {ECBench: Can Multi-modal Foundation Models Understand the Egocentric World? A Holistic Embodied Cognition Benchmark},
  author = {Ronghao Dang and Yuqian Yuan and Wenqi Zhang and Yifei Xin and Boqiang Zhang and Long Li and Liuyi Wang and Qinyang Zeng and Xin Li and Lidong Bing},
  journal= {arXiv preprint arXiv:2501.05031},
  year   = {2025}
}