即兴技能:面向LLM智能体的测试时自适应技能合成
计算与语言
2026-05-19 v1 人工智能
摘要
LLM智能体受益于可复用技能,但测试时的任务通常需要比静态技能库所能提供的更具体的指导。我们提出SkillTTA,一种测试时自适应技能合成方法,该方法检索与当前任务相关的一小组训练轨迹,并将其合成为一个临时的、任务特定的文本技能。求解器模型保持固定,因此自适应完全通过生成的上下文而非参数更新来实现。我们在SpreadsheetBench、ALFWorld和BigCodeBench上评估了该方法。与使用GPT-5.5的静态轨迹到技能合成相比,任务特定技能将SpreadsheetBench的Pass@1从0.397提升至0.505,将BigCodeBench的Pass@1从0.517提升至0.651。在ALFWorld上,该方法在成功率上匹配了更重的记忆学习基线(相差四个百分点以内),同时生成了所报告方法中最短的成功轨迹。在SpreadsheetBench上的消融实验进一步表明,合成技能优于原始轨迹提示,top-检索应保持较小规模,并且失败轨迹特别有用,因为它们暴露了重复出现的面向评估者的错误。
引用
@article{arxiv.2605.16986,
title = {Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents},
author = {Jingxing Wang and Chenyu Zhou and Zhihui Fu and Jun Wang and Weiwen Liu and Weinan Zhang and Jianghao Lin},
journal= {arXiv preprint arXiv:2605.16986},
year = {2026}
}
备注
10 pages, 4 figures