MetaSkill-Evolve:通过双时间尺度元技能进化实现LLM代理的递归自我改进
人工智能
2026-07-06 v1
摘要
最近的LLM代理处理越来越长视界、开放式的任务,而外部技能(提供给代理的可重用程序性知识)进一步扩展了这种能力。然而,固定的、手工编写的技能很少是最优的,并且无法适应代理遇到的任务多样性。自我改进代理通过从执行轨迹中重写自己的技能文件来解决这个问题,在具有挑战性的基准上取得了有意义的收益。然而,这种自我进化仍然是非递归的:它只改进任务技能(代理做什么),而改进过程(如何改进)是一次性编写并保持固定的。我们引入了MetaSkill-Evolve,一个双时间尺度框架,使代理技能改进递归化:每个分支都携带一个任务技能和一个分支局部元技能,其五个组件参数化了改进流程的分析器、检索器、分配器、提议器和进化器代理。任务技能在快速循环中进化,而元技能在较慢循环中在同一流程应用于自身的情况下进化,无需额外的模型或目标。所有五个流程代理共享一个冻结的主干,MetaSkill-Evolve在三个代理基准(OfficeQA、SealQA、ALFWorld)上优于无技能、静态技能和单级进化基线,在保留测试准确率上分别比原始主干提高了+23.54、+16.09和+1.92个百分点。
引用
@article{arxiv.2607.05297,
title = {MetaSkill-Evolve: Recursive Self-Improvement of LLM Agents via Two-Timescale Meta-Skill Evolution},
author = {Zefeng Wang and Minxi Yan and Jinhe Bi and Sikuan Yan and Volker Tresp and Yunpu Ma},
journal= {arXiv preprint arXiv:2607.05297},
year = {2026}
}