中文

PEAM:通过经验对比内化实现参数化具身智能体记忆

人工智能 2026-05-28 v1

摘要

我们提出了PEAM,一个在Minecraft中的参数化具身智能体记忆框架,它将智能体记忆从推理时检索转变为通过经验内化到参数中的技能。PEAM将一个用于开放式推理的缓慢审慎大语言模型与一个用于已巩固技能反射性执行的快速参数化模块配对。快速模块是一个多模态专家混合LoRA架构,具有按类别物理隔离的适配器,实现了无灾难性遗忘的参数级持续学习。我们将失败视为一等训练信号:失败-修正轨迹对通过联合行为克隆和对比目标进行内化,因此智能体不仅学习什么成功,还学习修正后的动作与失败动作有何不同。为了管理巩固,PEAM引入了一个参数化价值分数,用于决定哪些经验应该被内化,以及一个无尺度自触发巩固机制,用于决定何时内化,而无需任务特定的手动调整阈值,使得智能体能够自我进化,因为触发器可以在无需重新调整的情况下跨任务分布转移。在Minecraft中的实验表明,PEAM提高了长时域任务性能,减轻了对先前巩固技能的遗忘,并提高了参数化与检索的效率,优于基于检索的具身智能体和参数化记忆变体。

关键词

引用

@article{arxiv.2605.27762,
  title  = {PEAM: Parametric Embodied Agent Memory through Contrastive Internalization of Experience in Minecraft},
  author = {Yuchen Guo and Junli Gong and Hongmin Cai and Yiu-ming Cheung and Weifeng Su},
  journal= {arXiv preprint arXiv:2605.27762},
  year   = {2026}
}