Optimus-2:基于目标-观察-动作条件策略的多模态Minecraft智能体
人工智能
2025-03-12 v2
摘要
构建一个能够模仿人类行为模式以完成各种开放世界任务的智能体,是长期目标。为使智能体能够有效地学习跨越不同任务的行为模式,关键挑战在于建模观察、动作与语言之间的复杂关系。为此,我们提出了Optimus-2,一种集成多模态大语言模型(MLLM)进行高层次规划,同时采用目标-观察-动作条件策略(GOAP)进行低层次控制的Minecraft智能体。GOAP包含(1)面向动作的行为编码器,该编码器在每个时间步建模观察与动作之间的因果关系,然后动态地与历史观察-动作序列交互,将其整合为固定长度的行为标记;以及(2)一个MLLM,用于将行为标记与开放式语言指令对齐,以自回归方式预测动作。此外,我们引入了一个高质量的Minecraft目标-观察-动作(MGOA)数据集,包含25,000个视频,覆盖8个原子任务,提供约3000万个目标-观察-动作对。自动构建方法以及MGOA数据集,为社区训练Minecraft智能体的努力提供了贡献。大量实验结果表明,Optimus-2在Minecraft中的原子任务、长期程任务和开放式指令任务方面表现优异。请参阅项目页面https://cybertronagent.github.io/Optimus-2.github.io/。
引用
@article{arxiv.2502.19902,
title = {Optimus-2: Multimodal Minecraft Agent with Goal-Observation-Action Conditioned Policy},
author = {Zaijing Li and Yuquan Xie and Rui Shao and Gongwei Chen and Dongmei Jiang and Liqiang Nie},
journal= {arXiv preprint arXiv:2502.19902},
year = {2025}
}
备注
Accept to CVPR 2025, Project page: https://cybertronagent.github.io/Optimus-2.github.io/