基于归一化流与几何感知 Cramér 替代函数的参数高效分布式强化学习
人工智能
2026-05-06 v2 机器学习
最优化与控制
摘要
分布式强化学习 通过对完整的回报分布进行建模,改进了基于期望的方法,但标准方法通常仍不够精简。类别方法(如 C51)依赖于固定的支撑集,其参数数量随分辨率呈线性增长;而分位数方法将分布近似为离散混合,其分段常数密度在建模复杂多模态或重尾回报时会造成浪费。我们引入了 NFDRL,这是一种精简架构,使用连续归一化流 对回报分布进行建模。与类别基线不同,我们基于流的模型保持了紧凑的参数占用,不随分布的有效分辨率而增长,同时为回报提供了动态、自适应的支撑。为了训练这种连续表示,我们提出了一种受 Cramér 启发、基于从流中获得的概率质量定义的几何感知距离。我们证明该距离是一个真正的概率度量,相应的分布式 Bellman 算子是 sqrt(gamma)-收缩,且由此产生的目标函数允许无偏样本梯度,这些性质在以往基于 PDF 的 DistRL 方法中通常无法同时得到保证。实验表明,NFDRL 在玩具 MDP 上能恢复丰富的多模态回报图景,并在 Atari-5 基准测试上取得了与类别基线相媲美的性能,同时提供了显著更优的参数效率。
引用
@article{arxiv.2505.04310,
title = {Parameter-Efficient Distributional RL via Normalizing Flows and a Geometry-Aware Cram\'er Surrogate},
author = {Simo Alami C. and Rim Kaddah and Jesse Read and Marie-Paule Cani},
journal= {arXiv preprint arXiv:2505.04310},
year = {2026}
}