中文

MAGE:面向战略探索与利用的语言智能体的元强化学习

人工智能 2026-03-05 v1

摘要

大型语言模型 (LLM) 智能体在学习任务中展现出显著能力,但在反馈非平稳环境中常难以适应。虽然基于情境的学习和外部记忆提供了一定灵活性,但它们无法内化长期改进所需的适应能力。元强化学习 (meta-RL) 通过将学习过程直接嵌入模型来提供一种替代方案。然而,现有针对 LLM 的 meta-RL 方法主要关注单智能体环境中的探索,忽略了多智能体环境中必要的战略利用。我们提出 MAGE,一个使 LLM 智能体具备战略探索与利用能力的 meta-RL 框架。MAGE 采用多回合训练模式,将交互历史和反思整合到情境窗口中。通过将最终回合奖励作为目标,MAGE 鼓励智能体基于过去经验细化其策略。我们进一步结合基于群体的训练与智能体特定的收益归一化技术,以丰富智能体多样性并确保稳定学习。实验结果表明,MAGE 在探索和利用任务中均优于现有基线方法。此外,MAGE 对未见对手表现出强大的泛化能力,表明其已内化了战略探索与利用的能力。代码可在 https://github.com/Lu-Yang666/MAGE 获取。

关键词

引用

@article{arxiv.2603.03680,
  title  = {MAGE: Meta-Reinforcement Learning for Language Agents toward Strategic Exploration and Exploitation},
  author = {Lu Yang and Zelai Xu and Minyang Xie and Jiaxuan Gao and Zhao Shok and Yu Wang and Yi Wu},
  journal= {arXiv preprint arXiv:2603.03680},
  year   = {2026}
}