分布强化学习的分位数几何正则化
机器学习
2026-05-12 v1 人工智能
摘要
基于分位数的分布强化学习方法通过采样分位数回归学习回报分布,但其自举目标分位数可能导致扭曲或退化的分布估计。我们提出鲁棒分位数隐式分位数网络(RQIQN),这是一种从分位数估计视角增强的轻量级 Wasserstein 分布鲁棒增强方法。我们首先将 IQN 损失的一个快照重新解释为在采样的当前分位数上的一系列局部经验分位数估计问题。然后,我们使用 Wasserstein 分布鲁棒分位数估计公式对每个局部槽进行鲁棒化,从而产生一个对 Bellman 目标的闭式、依赖于分位数的校正。这种校正直接解决了分布退化问题:其中位数反对称性保留了风险中性的分位数平均值,而其单调性扩大了上下分位数间隙,并抵消了塌缩的分布散布。因此,RQIQN 在不改变底层价值目标或需要额外样本集重建的情况下,正则化了分位数几何。最后,我们通过实验证明,所提出的 RQIQN 在风险敏感的导航和 Atari 游戏中优于其他现有的基于分位数的分布强化学习算法。
引用
@article{arxiv.2605.08182,
title = {Quantile Geometry Regularization for Distributional Reinforcement Learning},
author = {Zhaofan Zhang and Minghao Yang and Rufeng Chen and Sihong Xie and Hui Xiong},
journal= {arXiv preprint arXiv:2605.08182},
year = {2026}
}