当机器人承担家务:长时程家庭任务执行的基准与智能体
人工智能
2026-05-19 v2
摘要
长时程家庭任务要求鲁棒的高层规划和持续的推理能力,而现有的具身 AI 基准在很大程度上忽视了这一点,它们强调短时程的导航或操作,并依赖于固定的任务类别。我们引入了 LongAct,这是一个旨在评估由自由格式指令指定的长时程家庭任务中规划级自主性的基准。通过抽象掉特定于具身形态的低层控制,LongAct 隔离了诸如指令理解、依赖管理、记忆维护和自适应规划等高层认知能力。我们进一步提出了 HoloMind,一个由视觉语言模型(VLM)驱动的智能体,配备基于有向无环图(DAG)的长时程分层规划器、用于持久世界建模的多模态空间记忆、用于经验复用的情景记忆,以及用于反思性监督的全局 Critic。使用 GPT-5 和 Qwen3-VL 模型的实验表明,HoloMind 显著提升了长时程性能,同时降低了对模型规模的依赖。即使是顶级模型也仅达到 59% 的目标完成率和 16% 的完整任务成功率,凸显了 LongAct 的难度以及在具身智能体中加强长时程规划的必要性。
引用
@article{arxiv.2605.14504,
title = {When Robots Do the Chores: A Benchmark and Agent for Long-Horizon Household Task Execution},
author = {Zilin Zhu and Longteng Guo and Yanghong Mei and Bowen Pang and Zongxun Zhang and Xingjian He and Ruyi Ji and Jing Liu},
journal= {arXiv preprint arXiv:2605.14504},
year = {2026}
}