RewardFlow:基于状态图的拓扑感知奖励传播,用于LLM主导型强化学习
人工智能
2026-05-29 v2 计算与语言
机器学习
摘要
强化学习 (RL) 显示出增强 LLM agentic reasoning 的潜力,但稀疏终端奖励阻碍了细粒度优化。过程奖励建模提供了一种替代方案,但面临高计算成本、奖励黑客风险和标注瓶颈。我们提出RewardFlow,一种用于估计 agentic reasoning 中状态层级奖励的轻量级方法。通过构建捕获轨迹内在拓扑结构的状态图,RewardFlow 执行拓扑感知的传播,以估计每个状态对成功贡献,从而获得原则且无标注的稠密奖励。用于 RL 优化,RewardFlow 在四个 agentic 基准测试中显著优于先前基线:文本任务平均成功率提高6.2%,视觉推理在最强基线上提升29.7%(跨三个模型规模),DeepResearch 准确率提高10%,并在鲁棒性和训练效率方面表现优异。RewardFlow 实现已公开于 GitHub 提供:https://github.com/tmlr-group/RewardFlow。
引用
@article{arxiv.2603.18859,
title = {RewardFlow: Topology-Aware Reward Propagation on State Graphs for Agentic RL with Large Language Models},
author = {Xiao Feng and Bo Han and Zhanke Zhou and Jiaqi Fan and Jiangchao Yao and Ka Ho Li and Dahai Yu and Michael Kwok-Po Ng},
journal= {arXiv preprint arXiv:2603.18859},
year = {2026}
}