T²PO: 基于不确定性引导的稳定多回合无代理强化学习探索控制
人工智能
2026-05-05 v1
摘要
近期在多回合强化学习 (RL) 方面的进展显著提升了大型语言模型在复杂交互任务上的性能。尽管存在细粒度信用分配和轨迹过滤等稳定性技术的进展,但不稳定性仍然普遍存在,常导致训练崩溃。我们认为,这种不稳定性源于多回合环境中的高效探索不足,策略持续生成既不减少不确定性又不推进任务进程的低信息动作。为解决此问题,我们提出了 Token 级和回合级策略优化 (T²PO),一个基于不确定性的框架,显式控制细粒度的探索。/token 级,T²PO 监控不确定性动态,一旦边际不确定性变化降至阈值以下,即触发思考干预。/turn 级,T²PO 识别探索进度可忽略的交互,动态重采样此类回合以避免浪费的 rollout。我们在 WebShop、ALFWorld 和 Search QA 等多样化环境中评估了 T²PO,证明其在训练稳定性和探索效率方面均取得显著提升。代码已公开:https://github.com/WillDreamer/T2PO。
引用
@article{arxiv.2605.02178,
title = {T$^2$PO: Uncertainty-Guided Exploration Control for Stable Multi-Turn Agentic Reinforcement Learning},
author = {Haixin Wang and Hejie Cui and Chenwei Zhang and Xin Liu and Shuowei Jin and Shijie Geng and Xinyang Zhang and Nasser Zalmout and Zhenyu Shi and Yizhou Sun},
journal= {arXiv preprint arXiv:2605.02178},
year = {2026}
}
备注
25 pages, 7 figures, 8 tables. Accepted to ICML 2026 as a Spotlight Paper