中文

通过迭代步骤级过程细化学习 LLM 代理

计算与语言 2024-09-26 v2 人工智能 机器学习

摘要

大型语言模型代理在各类复杂交互任务中展现出卓越的性能。最近的方法通过专家轨迹进行调优以提升代理性能,但主要关注结果奖励,可能因缺乏过程监督信号而导致错误或亚最优动作。本文引入了迭代步骤级过程细化(Iterative step-level Process Refinement, IPR)框架,提供详细的逐步指导以提升代理训练。具体而言,我们采用蒙特卡洛方法估计步骤级奖励。在每次迭代中,代理沿着专家轨迹进行探索并生成新的动作。这些动作随后根据对应的步骤奖励对比专家轨迹中的动作。这种比较有助于识别差异,产生用于训练代理的对比动作对。我们在三个复杂代理任务上的实验表明,框架在各种强基线上均表现出色。此外,我们的分析结果凸显了 IPR 在提升动作效率方面的有效性以及其对各种模型的适用性。

关键词

引用

@article{arxiv.2406.11176,
  title  = {Watch Every Step! LLM Agent Learning via Iterative Step-Level Process Refinement},
  author = {Weimin Xiong and Yifan Song and Xiutian Zhao and Wenhao Wu and Xun Wang and Ke Wang and Cheng Li and Wei Peng and Sujian Li},
  journal= {arXiv preprint arXiv:2406.11176},
  year   = {2024}
}

备注

Accepted to EMNLP 2024 (Main Conference)