面向 LLM 智能体的过程奖励模型:实用框架与方向
机器学习
2025-02-17 v1 人工智能
摘要
我们提出 Agent Process Reward Models(AgentPRM),这是一种简单且可扩展的框架,用于训练 LLM 智能体通过交互不断改进。AgentPRM 遵循轻量级 actor-critic 范式,使用蒙特卡洛 rollout 计算奖励目标并优化策略。它对现有 RLHF 流水线的修改要求最低,使其在大规模部署中易于集成。除 AgentPRM 外,我们提出 InversePRM,直接从演示中学习过程奖励,而无需明确的结果监督。我们还探讨了关键挑战和机会,包括探索、过程奖励塑形和模型预测推理。我们在 ALFWorld 基准测试上进行评估,展示在 AgentPRM 和 InversePRM 训练的小型 3B 模型在强大的 GPT-4o 基准线上取得优异性能,并分析了测试时规模、奖励作弊等问题。我们的代码可在 https://github.com/sanjibanc/agent_prm 查阅。
引用
@article{arxiv.2502.10325,
title = {Process Reward Models for LLM Agents: Practical Framework and Directions},
author = {Sanjiban Choudhury},
journal= {arXiv preprint arXiv:2502.10325},
year = {2025}
}
备注
17 pages, 7 figures