基于分位数耦合流匹配的分布式强化学习
机器学习
2026-05-12 v1 机器人学
摘要
与标准期望回报强化学习(RL)不同,分布式强化学习(DRL)建模完整的回报分布,更适合不确定性感知和风险敏感决策。条件流匹配(CFM)评论家最近受到关注,用于建模连续多模态回报分布。尽管存在这种兴趣,但仍存在显著的度量不匹配:DRL理论依赖于分布式 Bellman算子在-Wasserstein距离下具有收缩性,而现有CFM评论家使用任意源-目标配对,其流匹配损失并非用于匹配Bellman目标回报分布的Wasserstein对齐替代品。在本工作中,我们通过提出FlowIQN,一种CFM评论家,对源和Bellman目标样本在每个mini-batch内进行排序以逼近单调最优传输配对,替换任意配对,使其与分位数对齐的流路径相匹配。我们证明,量化耦合CFM评论家的损失产生与DRL基础理论相容的Wasserstein对齐近似投影。就FlowIQN而言,这是首个具有显式Wasserstein对齐投影保证的流匹配分布式评论家。我们进一步通过shortcut模型扩展FlowIQN,以实现高效推理。实验结果表明,FlowIQN在其他CFM评论家基础上提高了Wasserstein回报分布精度。它还在多个策略提取方法上的离线RL基准上实现了竞争性能,提供了一个在DRL管道中易于集成的理论上有据可依的CFM评论家。代码:https://github.com/ori-goals/flowIQN。
关键词
引用
@article{arxiv.2605.08515,
title = {Quantile-Coupled Flow Matching for Distributional Reinforcement Learning},
author = {Michael Groom and Victor-Alexandru Darvariu and Lars Kunze and James Wilson and Nick Hawes},
journal= {arXiv preprint arXiv:2605.08515},
year = {2026}
}