面向多维奖励函数的分布强化学习
机器学习
2021-10-27 v1
摘要
基于价值的强化学习(RL)算法的一个日益增长趋势是在价值网络中捕获比标量价值函数更多的信息。该分支中最著名的方法之一是分布强化学习,其建模回报分布而非标量价值。在另一项工作中,RL 中的混合奖励架构(HRA)已研究为每一奖励来源建模特定来源的价值函数,这同样被证明有益于性能。为充分继承分布强化学习与混合奖励架构的优势,我们提出多维分布 DQN(MD3QN),将分布强化学习扩展以建模来自多个奖励来源的联合回报分布。作为联合分布建模的副产品,MD3QN 不仅能捕获各奖励来源回报中的随机性,还能捕获不同来源随机性之间丰富的奖励相关性。我们证明了联合分布 Bellman 算子的收敛性,并通过最小化联合回报分布与其 Bellman 目标之间的最大均值差异来构建经验算法。在实验中,我们的方法在具有丰富相关奖励函数的环境中准确建模联合回报分布,并在控制设定下优于以往利用多维奖励函数的 RL 方法。
引用
@article{arxiv.2110.13578,
title = {Distributional Reinforcement Learning for Multi-Dimensional Reward Functions},
author = {Pushi Zhang and Xiaoyu Chen and Li Zhao and Wei Xiong and Tao Qin and Tie-Yan Liu},
journal= {arXiv preprint arXiv:2110.13578},
year = {2021}
}
备注
Accepted by NeurIPS 2021