RN-D:用于基于离散分类行为的正则化网络的 on-policy 强化学习
机器学习
2026-02-02 v1 机器人学
摘要
基于策略的深度强化学习仍是连续控制的主流范式,但标准实现依赖于高斯行为者和相对浅薄的 MLP 策略,往往在梯度噪声较大且策略更新必须保守的情况下导致优化脆弱。本文我们重新审视将策略表示视为首要设计选择。我们研究离散分类行为者,这些行为者通过对每个动作维度上的分布对箱体进行表示,yielding a policy objective that resembles a cross-entropy loss。基于监督学习中的架构进步,我们进一步提出正则化行为者网络,而保持批评家设计不变。我们的结果表明,仅将标准行为者网络替换为我们的离散正则化行为者即可获得一致的提升,并在多样化的连续控制基准任务中实现最先进的性能。
引用
@article{arxiv.2601.23075,
title = {RN-D: Discretized Categorical Actors with Regularized Networks for On-Policy Reinforcement Learning},
author = {Yuexin Bian and Jie Feng and Tao Wang and Yijiang Li and Sicun Gao and Yuanyuan Shi},
journal= {arXiv preprint arXiv:2601.23075},
year = {2026}
}