中文

协同烹饪与清洁:教授具身智能体进行并行任务执行

计算机视觉与模式识别 2025-11-25 v1

摘要

任务调度对于具身 AI 至关重要,使智能体能够遵循自然语言指令并在 3D 物理世界中高效执行动作。然而,现有的数据集通常通过忽略运筹学知识和 3D 空间定位来简化任务规划。在这项工作中,我们提出了 Operations Research knowledge-based 3D Grounded Task Scheduling (ORS3D),一个需要语言理解、3D 定位和效率优化协同作用的新任务。与先前的设置不同,ORS3D 要求智能体通过利用可并行的子任务来最小化总完成时间,例如在微波炉运行时清洁水槽。为了促进 ORS3D 的研究,我们构建了 ORS3D-60K,一个包含 4K 个真实场景中共 60K 个复合任务的大规模数据集。此外,我们提出了 GRANT,一个配备简单而有效的调度标记机制的具身多模态大语言模型,用于生成高效的任务调度和定位动作。在 ORS3D-60K 上的大量实验验证了 GRANT 在语言理解、3D 定位和调度效率方面的有效性。代码可在 https://github.com/H-EmbodVis/GRANT 获取。

关键词

引用

@article{arxiv.2511.19430,
  title  = {Cook and Clean Together: Teaching Embodied Agents for Parallel Task Execution},
  author = {Dingkang Liang and Cheng Zhang and Xiaopeng Xu and Jianzhong Ju and Zhenbo Luo and Xiang Bai},
  journal= {arXiv preprint arXiv:2511.19430},
  year   = {2025}
}

备注

Accepted to AAAI 2026 (Oral). The code is available at \url{https://github.com/H-EmbodVis/GRANT}