中文

STeCa:面向 LLM Agent 学习的步骤级轨迹校准

机器学习 2025-05-30 v2 人工智能 计算与语言

摘要

大型语言模型(LLM)基的智能体在通过与环境的动态交互来解决复杂任务方面显示出前景。现有工作主要集中在从专家演示中进行行为克隆或通过探索性轨迹抽样进行偏好学习。然而,这些方法往往难以应对长期任务,其中次优动作会逐步累积,导致智能体偏离正确的任务轨迹。为此,我们强调及时校准的重要性,以及需要自动构建校准轨迹用于训练智能体的需求。我们提出了步骤级轨迹校准(STeCa),这是一种新的 LLM 智能体学习框架。具体而言,STeCa 通过在探索期间进行步骤级奖励比较来识别次优动作。它利用 LLM 驱动的反思构建校准后的轨迹,使智能体能够从改进的决策过程中学习。最后,我们将这些校准后的轨迹与成功的轨迹一起用于强化学习训练。广泛的实验表明,STeCa 显著优于现有方法。进一步的分析表明,及时校准使智能体能够更具鲁棒性地完成任务。我们的代码和数据已在 https://github.com/WangHanLinHenry/STeCa 上提供。

关键词

引用

@article{arxiv.2502.14276,
  title  = {STeCa: Step-level Trajectory Calibration for LLM Agent Learning},
  author = {Hanlin Wang and Jian Wang and Chak Tou Leong and Wenjie Li},
  journal= {arXiv preprint arXiv:2502.14276},
  year   = {2025}
}

备注

Accepted by ACL2025 Findings