中文

评估基于日常复合任务的多模态大语言模型在家庭环境中的表现

人工智能 2025-11-21 v2

摘要

人工通用智能(AGI)与传统人工智能的关键区别在于,AGI 能够执行需要广泛能力的复合任务。虽然以多模态大语言模型(MLLMs)为动力的具身智能体拥有丰富的感知和交互能力,但它们是否能够解决复合任务仍基本未知。在本工作中,我们设计了一组受早期发展阶段日常活动启发的复合任务。这些任务在动态且仿真的家庭环境中展开,涵盖三个核心领域:对象理解、空间智能和社交活动。我们对 17 项领先的专有和开源 MLLMs 对这些任务进行了评估。结果在所有三个领域的表现都很差,表明当前能力与通用智能要求之间存在显着差距。我们这组任务为评估具身智能体的通用能力提供了初步框架,标志着向开发具身 MLLMs 及其实际部署迈出了早期但重要的一步。

关键词

引用

@article{arxiv.2509.17425,
  title  = {Evaluating Multimodal Large Language Models with Daily Composite Tasks in Home Environments},
  author = {Zhenliang Zhang and Yuxi Wang and Hongzhao Xie and Shiyun Zhao and Mingyuan Liu and Yujie Lu and Xinyi He and Zhenku Cheng and Yujia Peng},
  journal= {arXiv preprint arXiv:2509.17425},
  year   = {2025}
}