中文

基于分位数回归的分布强化学习的 Cramér 距离视角

机器学习 2022-02-23 v2 机器学习

摘要

分布强化学习(DRL)通过近似未来回报的完整分布而非仅均值,扩展了基于价值的方法,提供了更丰富的信号从而带来性能提升。基于分位数回归(QR)的方法(如 QR-DQN)通过最小化 1-Wasserstein 距离,将任意分布投影到阶梯分布的一个参数化子集中。然而,由于梯度中的偏差,训练时改用分位数回归损失,其保证相同的最小化子并享有无偏梯度。对分位数的非交叉约束已被证明能改善 QR-DQN 在基于不确定性的探索策略上的性能。本工作的贡献在于固定分位数水平的设定下,并具有两方面。首先,我们证明 Cramér 距离给出的投影与 1-Wasserstein 投影一致,并且在非交叉约束下,平方 Cramér 损失与分位数回归损失产生共线的梯度,从而阐明了 DRL 这些重要元素之间的联系。其次,我们提出了一种计算 Cramér 距离的低复杂度算法。

关键词

引用

@article{arxiv.2110.00535,
  title  = {A Cram\'er Distance perspective on Quantile Regression based Distributional Reinforcement Learning},
  author = {Alix Lhéritier and Nicolas Bondoux},
  journal= {arXiv preprint arXiv:2110.00535},
  year   = {2022}
}

备注

Substantial changes in the experimental part, in particular in the architectures used for our results. Improvements in the presentation of the proof of Lemma 2. Added a Section to show soundness of TD-learning. To be published in AISTATS 2022