面向迭代优化的推理导向轮次级强化学习:TL-GRPO
计算与语言
2026-01-26 v1
摘要
大型语言模型通过工具集成在复杂任务中展现出强大的推理能力,这通常被建模为马尔可夫决策过程,并使用轨迹级强化学习算法(如GRPO)进行优化。然而,一类常见的推理任务——迭代优化——存在distinct挑战:智能体在跨轮次中与同一环境状态交互,其轨迹价值由最佳轮次级奖励而非累积回报决定。现有GRPO方法无法在此类设置下进行细粒度的轮次级优化,而黑箱优化方法则丢弃了先验知识和推理能力。为填补这一差距,我们提出轮次级GRPO(TL-GRPO),一种轻量级强化学习算法,通过轮次级分组采样实现细粒度优化。我们在模拟电路尺寸(ACS)问题上评估了TL-GRPO,这是一个需要多次仿真和领域专业知识的具有挑战性的科学优化任务。结果表明,TL-GRPO在各种规格下均优于标准GRPO和贝叶斯优化方法。此外,在相同仿真预算下,我们300亿参数模型使用TL-GRPO训练后,在ACS任务上实现最先进性能,展现出强大的泛化能力和实际应用价值。
引用
@article{arxiv.2601.16480,
title = {TL-GRPO: Turn-Level RL for Reasoning-Guided Iterative Optimization},
author = {Peiji Li and Linyang Li and Handa Sun and Wenjin Mai and Yongkang Chen and Xiaozhe Li and Yue Shen and Yichuan Ma and Yiliu Sun and Jiaxi Cao and Zhishu He and Bo Wang and Xiaoqing Zheng and Zhaori Bi and Xipeng Qiu and Qipeng Guo and Kai Chen and Dahua Lin},
journal= {arXiv preprint arXiv:2601.16480},
year = {2026}
}
备注
Work in progress