序数策略的策略梯度方法
机器学习
2025-06-24 v1
摘要
在强化学习中,softmax参数化是离散动作空间策略的标准方法。然而,它无法捕捉动作之间的位置关系。为了解决实际工业中的问题,本文提出一种基于序数回归模型参数化策略的新方法,适用于强化学习环境。该方法解决了实际挑战,数值实验表明在实际应用和连续动作任务中效果显著,其中对动作空间进行离散化并应用序数策略可实现与之竞争的性能。
关键词
引用
@article{arxiv.2506.18614,
title = {Policy gradient methods for ordinal policies},
author = {Simón Weinberger and Jairo Cugliari},
journal= {arXiv preprint arXiv:2506.18614},
year = {2025}
}
备注
in French language, Journ{\'e}es de statistiques 2025, Soci{\'e}t{\'e} Fran\c{c}aise des Statistiques, Jun 2023, Marseille, France