中文

PPO-BR:基于双信号熵-奖励适配的信任区间策略优化

机器学习 2025-05-26 v1 人工智能 计算与语言

摘要

尽管PPO(Proximal Policy Optimization)在策略梯度方法中占据主导地位——从机器人控制到游戏AI——其静态信任区间导致脆弱的权衡:激进的裁剪抑制了早期探索,而迟-stage的更新又会 destabilize收敛。PPO-BR通过融合探索和收敛信号于单一受限信任区间,建立了自适应强化学习的新范式,这一理论上有据可依的创新性方法在五大SOTA基准中均表现优异,仅需不到2%的开销。本工作搭建了相位感知学习中的关键鸿沟,使其在单一自适应机制下即可实现面向安全关键系统(如机器人手术)的实际部署。PPO-BR通过结合:(1)基于熵的扩展(epsilon up)实现高不确定性状态下的探索,和(2)基于奖励的收缩(epsilon down)实现收敛稳定性,在六个多样化基准(MuJoCo、Atari、稀疏奖励)上实现收敛速度提升29.1%(p<0.001),奖励方差比PPO低2.3倍,运行时开销不足1.8%,仅需五行代码修改。PPO-BR的简洁性与理论保证使其即可部署于安全关键领域——从外科机器人到自主无人机。与最近如Group Relative Policy Optimization (GRPO)等方法不同,PPO-BR提供的是一种统一的熵-奖励机制,可同时适用于语言模型和通用强化学习环境。

关键词

引用

@article{arxiv.2505.17714,
  title  = {PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization},
  author = {Ben Rahman},
  journal= {arXiv preprint arXiv:2505.17714},
  year   = {2025}
}

备注

This manuscript builds upon an earlier version posted to TechRxiv. This arXiv version includes an updated comparison with GRPO (Group Relative Policy Optimization)