MineEvolve:基于累积知识的长期 embodied Minecraft 代理自演化
人工智能
2026-05-12 v3
摘要
长期 embodied 智能需要通过与环境交互来实现提升,而不仅仅是执行来自静态目标生成的计划。因此,一个核心挑战在于将过去的执行转化为可以塑造未来决策的知识。Minecraft 提供了一个以此问题为代表的测试平台,其中诸如制作工具、构建红石组件和获取钻石装备等任务涉及长期依赖链,并且经常因工具缺失、路径被阻、GUI 故障或执行停滞而被中断。为此,我们提出了 MineEvolve 框架,这是一个以知识为驱动的自演化框架,将执行反馈转化为可操作的行为知识。MineEvolve 首先使用 \underline{\emph{\textbf{\ding{182}Monitor}}} 将每个子目标执行转换为类型化反馈,包括状态变化、库存变化、故障类型、进度信号和停滞指示。\underline{\emph{\textbf{\ding{183}Inducer}}} 然后从成功的执行中派生可重用的技能,并从失败或停滞的执行中派生补救措施。\underline{\emph{\textbf{\ding{184}Curator}}} 对这些知识条目进行验证、合并、过滤和检索,而 \underline{\emph{\textbf{\ding{185}Adaptor}}} 则在反复遇到失败或停滞时用于修复计划中未完成的部分。Minecraft MCU 长期任务套件上的实验表明,MineEvolve 在多个语言模型计划器上均能稳定地提升性能,在高依赖任务组上的提升尤为显著。消融实验和知识累积研究进一步表明,将执行信号转化为结构化行为知识是实现长期环境下自演化具身代理的有效路径。我们的代码可在 https://github.com/xzw-ustc/MC-MineEvolve 获取。
引用
@article{arxiv.2603.13131,
title = {MineEvolve: Self-Evolution with Accumulated Knowledge for Long-Horizon Embodied Minecraft Agents},
author = {Zhengwei Xie and Zhisheng Chen and Ziyan Weng and Jinhan Li and Chenglong Li and Zikai Xiao and Jingwei Song and Jinhao Jing and Vireo Zhang and Kun Wang},
journal= {arXiv preprint arXiv:2603.13131},
year = {2026}
}