面向长程交互式 LLM 智能体的强化学习
机器学习
2025-03-11 v3 人工智能
摘要
交互式数字智能体(IDA)利用有状态数字环境的 API 来响应用户请求执行任务。虽然由指令微调的大语言模型(LLM)驱动的 IDA 能够在多步交互中对接口调用的反馈做出反应,但它们并未在各自的数字环境中接受过训练。先前的方法在诸如 AppWorld 等复杂基准测试中完成的任务不到一半。我们提出了一种强化学习(RL)方法,直接在目标环境中训练 IDA。我们将此训练形式化为部分可观测马尔可夫决策过程,并推导出 LOOP,一种数据和内存高效的近端策略优化变体。LOOP 不使用价值网络,并在内存中仅维护一份底层 LLM 的副本,使其实现简单直接,且内存效率与微调单个 LLM 相当。在 AppWorld 环境中使用 LOOP 训练的 320 亿参数智能体,其性能比大得多的 OpenAI o1 智能体高出 9 个百分点(相对提升 15%)。据我们所知,这是首次报道将 RL 应用于通过直接 API 调用与有状态、多领域、多应用环境交互的 IDA。我们的分析揭示了 RL 在该领域的有效性,表明智能体学会了查阅 API 文档、避免无根据的假设、减少虚构并从中断中恢复。
引用
@article{arxiv.2502.01600,
title = {Reinforcement Learning for Long-Horizon Interactive LLM Agents},
author = {Kevin Chen and Marco Cusumano-Towner and Brody Huval and Aleksei Petrenko and Jackson Hamburger and Vladlen Koltun and Philipp Krähenbühl},
journal= {arXiv preprint arXiv:2502.01600},
year = {2025}
}