中文

Memento: 无需微调LLM的LLM智能体微调

机器学习 2025-08-26 v2 计算与语言

摘要

本文提出了一种新型的自适应大语言模型(LLM)智能体学习范式,无需微调底层LLM。现有方法要么依赖静态、手工设计的反思工作流而僵化,要么需要LLM模型参数的梯度更新而计算密集。与之相反,我们的方法通过基于记忆的在线强化学习实现低成本的持续适应。我们将其形式化为记忆增强马尔可夫决策过程(M-MDP),配备神经案例选择策略以指导动作决策。过去经验存储于情景记忆中,可微分或非参数化。策略通过记忆重写机制根据环境反馈持续更新,而策略改进则通过高效的记忆读取(检索)实现。我们在深度研究场景中实例化我们的智能体模型,即Memento,在GAIA验证集上达到top-1(Pass@3为87.88%),测试集上为79.40%。在DeepResearcher数据集上达到66.6%的F1和80.4%的PM,优于最先进的基于训练的方法,而基于案例的记忆在分布外任务上增加了4.7%至9.6%的绝对提升。我们的方法为开发能够无需梯度更新即可持续实时学习的通用LLM智能体提供了可扩展且高效的途径,推动机器学习迈向开放式技能获取和深度研究场景。代码可在https://github.com/Agent-on-the-Fly/Memento获取。

关键词

引用

@article{arxiv.2508.16153,
  title  = {Memento: Fine-tuning LLM Agents without Fine-tuning LLMs},
  author = {Huichi Zhou and Yihang Chen and Siyuan Guo and Xue Yan and Kin Hei Lee and Zihan Wang and Ka Yiu Lee and Guchun Zhang and Kun Shao and Linyi Yang and Jun Wang},
  journal= {arXiv preprint arXiv:2508.16153},
  year   = {2025}
}