中文

元策略反思:面向资源高效 LLM 智能体的可复用反思记忆与规则可采性

人工智能 2025-09-09 v2

摘要

大型语言模型 (LLM) 智能体在单任务性能上取得了显著成果,但常常表现出重复性错误、低效探索以及跨任务适应性有限的问题。现有的反思策略(如 Reflexion、ReAct)虽能提升单次 episode 的表现,但通常生成的反思痕迹是短暂的、针对特定任务的,无法在跨任务间复用。基于强化学习的方法虽能产生可迁移的策略,但需要大量的参数更新和计算资源。本文引入了元策略反思 (Meta-Policy Reflexion, MPR):一种混合框架,将 LLM 生成的反思整合为结构化的、类似谓词的元策略记忆 (Meta-Policy Memory, MPM),并通过软记忆引导解码和硬规则可采性检查 (HAC) 两种作用机制在推理阶段应用该记忆。MPR (1) 在不更新模型权重的情况下外部化了可复用的纠错知识,(2) 通过域约束减少非法或不安全的动作,(3) 保持了基于语言的反思的适应性。我们形式化了 MPM 的表示方法,提出了更新和解码算法,并在文本智能体环境中进行验证,遵循提供的实现方案中的实验协议(基于 AlfWorld)。在所提供材料中报告的实证结果表明,与 Reflexion 基线相比,MPR 在执行准确性和鲁棒性方面 consistently 获得提升;规则可采性进一步提高了稳定性。我们分析了解释这些提升的机制,讨论了可扩展性和失效模式,并概述了面向多模态和多智能体扩展的未来方向。

关键词

引用

@article{arxiv.2509.03990,
  title  = {Meta-Policy Reflexion: Reusable Reflective Memory and Rule Admissibility for Resource-Efficient LLM Agent},
  author = {Chunlong Wu and Ye Luo and Zhibo Qu and Min Wang},
  journal= {arXiv preprint arXiv:2509.03990},
  year   = {2025}
}