中文

序数策略的策略梯度方法

机器学习 2025-06-24 v1

摘要

在强化学习中,softmax参数化是离散动作空间策略的标准方法。然而,它无法捕捉动作之间的位置关系。为了解决实际工业中的问题,本文提出一种基于序数回归模型参数化策略的新方法,适用于强化学习环境。该方法解决了实际挑战,数值实验表明在实际应用和连续动作任务中效果显著,其中对动作空间进行离散化并应用序数策略可实现与之竞争的性能。

关键词

引用

@article{arxiv.2506.18614,
  title  = {Policy gradient methods for ordinal policies},
  author = {Simón Weinberger and Jairo Cugliari},
  journal= {arXiv preprint arXiv:2506.18614},
  year   = {2025}
}

备注

in French language, Journ{\'e}es de statistiques 2025, Soci{\'e}t{\'e} Fran\c{c}aise des Statistiques, Jun 2023, Marseille, France