不要只微调智能体,要微调环境
人工智能
2026-02-02 v2
摘要
大语言模型(LLM)智能体在复杂、多轮工具使用任务中展现出巨大潜力,但其开发常受困于高质量训练数据的极度匮乏。在合成数据上进行监督微调(SFT)会导致过拟合,而标准强化学习(RL)则面临严重的冷启动问题和训练不稳定性。为应对这些挑战,我们提出 (环境微调),一种全新的训练范式,使智能体能够直接从问题实例中学习复杂行为,而无需依赖预先收集的专家轨迹。 通过结构化课程、可操作的(actionable)环境增强(提供纠错反馈)以及细粒度的进度奖励来协调这一学习过程,从而确保稳定且高效的探索。仅使用来自 Berkeley Function-Calling Leaderboard(BFCL)基准的 400 个问题实例,我们的方法不仅在分布内性能上与强基线具有竞争力,还在分布外泛化方面表现出显著优势,克服了 SFT 类方法常见的性能崩溃问题。本工作实现了从基于静态轨迹的监督微调到基于环境的动态探索的范式转变,为训练更鲁棒、数据更高效的智能体铺平了道路。代码已开源:https://github.com/inclusionAI/AWorld-RL/tree/main/EnvTuning。
引用
@article{arxiv.2510.10197,
title = {Don't Just Fine-tune the Agent, Tune the Environment},
author = {Siyuan Lu and Zechuan Wang and Hongxuan Zhang and Qintong Wu and Leilei Gan and Chenyi Zhuang and Jinjie Gu and Tao Lin},
journal= {arXiv preprint arXiv:2510.10197},
year = {2026}
}
备注
ICLR 2026