训练语言智能体以从经验中学习
机器学习
2026-05-21 v1 人工智能
计算与语言
摘要
语言智能体可以在交互式环境中从经验中进行适应,但当前的反思基于的方法只能在单个任务实例内进行自我纠正。是否可以将这种经验蒸馏为可重用的教训,以提高对未来未见任务的表现尚不清楚。我们通过引入 In-context Training (ICT) 任务,一个用于评估语言智能体跨任务自我改进的框架来解决此问题。在 ICT 中,反射模型观察由演员模型收集的轨迹,并生成旨在提高演员在未来未见任务上表现的系统提示。我们随后提出了一个基于强化学习的训练管道,直接从经验中学习这些反思,而无需人工提供示例。在 ALFWorld 和 MiniHack 上,我们训练的反射器在大多数保留下未见任务族上均优于未训练的基线,表明从经验中学习的能力本身也可以被学习。在某些情况下,我们观察到对反射器训练所使用的基准之外的 substantially different 环境的泛化。最后,我们引入 MetaGym,一个用于构建元环境的通用 Python 库,使未来研究在自我改进语言智能体方面成为可能。
引用
@article{arxiv.2605.20477,
title = {Training Language Agents to Learn from Experience},
author = {Yuval Shalev and Zifeng Ding and Mateja Jamnik},
journal= {arXiv preprint arXiv:2605.20477},
year = {2026}
}