中文

AgentHER:面向 LLM Agent 轨迹重标的 Hindsight Experience Replay

人工智能 2026-05-12 v4 计算与语言

摘要

LLM-agent 训练管道常常丢弃失败的轨迹,尽管 GPT-4o 在 WebArena 上的成功率仅为 14-20%,在 ToolBench 上低于 55%;即使是专用系统在 50-65% 也会导致大部分轨迹未被利用。我们提出 AgentHER,通过将 Hindsight Experience Replay (HER) 应用于自然语言 agent 轨迹来恢复这种损失的信号:一条因目标 A 失败的轨迹,往往是可实现备选目标 B 的正确演示。AgentHER 通过四阶段管道实现:失败分类、结果提取、LLM 指导的重标(带置信度门控)和数据包装,将被丢弃的失败转化为 SFT、DPO 和 ShareGPT 训练数据。在 WebArena 和 ToolBench 上采用严格任务不相干的 held-out 协议评估,AgentHER 相比仅使用成功的 SFT 方式在四个模型家族(GPT-4o、Qwen2.5-72B/7B、LLaMA-3.1-8B)上提升 7.6-11.4%,实现 2 倍样本效率,并以 +3.0-6.2% 的优势战胜最强的经验导向基线(Agent Workflow Memory)。两种鲁棒机制——失败严重程度加权和跨模型多裁判验证(gpt-4o-mini 搭配 Qwen2.5-72B-Instruct)将标签噪声从 5.9% 降至 2.9%,并将 WebArena 和 ToolBench 上的人类评估重标精度提升至 97.1% 和 96.0%。一项完整的系统成本审计显示,整个重标管道为 3,000 条轨迹耗时仅需 2.98 和 26 个 wall-clock 分钟,即每接受的配对仅需 1.4 x 10^-3 的成本。代码:https://github.com/alphadl/AgentHER

关键词

引用

@article{arxiv.2603.21357,
  title  = {AgentHER: Hindsight Experience Replay for LLM Agent Trajectory Relabeling},
  author = {Liang Ding},
  journal= {arXiv preprint arXiv:2603.21357},
  year   = {2026}
}