中文

RPMS: 通过规则增强记忆协同增强基于LLM的具体化规划

人工智能 2026-03-19 v1

摘要

LLM智能体在封闭世界具体化环境中常常失败,因为动作必须满足严格的前提条件——例如位置、库存和容器状态——且失败反馈稀疏。我们识别出两种结构耦合的失败模式:(P1)无效动作生成和(P2)状态漂移,两者在退化循环中相互放大。我们提出了RPMS,一种冲突管理架构,它通过结构化规则检索强制执行动作可行性,通过轻量级信念状态门控记忆适用性,并通过规则优先仲裁解决两个来源之间的冲突。在ALFWorld(134个未见任务)上,RPMS使用Llama 3.1 8B实现了59.7%的单次尝试成功率(比基线高23.9个百分点),使用Claude Sonnet 4.5实现了98.5%(高11.9个百分点);在8B模型的增益中,仅规则检索一项就贡献了14.9个百分点(统计显著),使其成为主导因素。一个关键发现是,情景记忆有条件地有用:当无根据地使用时,它会在某些任务类型上损害性能,但一旦通过当前状态过滤并由显式动作规则约束,它就会成为一个稳定的净正收益。将RPMS适配到ScienceWorld并使用GPT-4,在所有消融条件下都取得了一致的增益(平均得分54.0对比ReAct基线的44.9),这提供了核心机制在结构不同的环境中成立的迁移证据。

关键词

引用

@article{arxiv.2603.17831,
  title  = {RPMS: Enhancing LLM-Based Embodied Planning through Rule-Augmented Memory Synergy},
  author = {Zhenhang Yuan and Shenghai Yuan and Lihua Xie},
  journal= {arXiv preprint arXiv:2603.17831},
  year   = {2026}
}