弥合基于值与基于策略的强化学习之间的鸿沟
人工智能
2017-11-27 v3 机器学习
机器学习
摘要
我们基于 softmax 时间值一致性与熵正则下策略最优性之间的关系,建立了基于值的和基于策略的强化学习(RL)之间的新联系。具体而言,我们表明 softmax 一致的动作值对应于沿任意动作序列(无论来源)的最优熵正则化策略概率。由该观察,我们开发了一种新的 RL 算法——路径一致性学习(PCL),其最小化从同策略与异策略轨迹中提取的多步动作序列上的软一致性误差概念。我们考察了 PCL 在不同场景下的行为,并展示 PCL 可被解释为对 actor-critic 与 Q-learning 算法的推广。我们随后通过展示如何使用单一模型表示策略及相应的 softmax 状态值,从而消除对独立评论员的需求,深化了该关系。实验评估表明,PCL 在多个基准上显著优于强大的 actor-critic 与 Q-learning 基线。
引用
@article{arxiv.1702.08892,
title = {Bridging the Gap Between Value and Policy Based Reinforcement Learning},
author = {Ofir Nachum and Mohammad Norouzi and Kelvin Xu and Dale Schuurmans},
journal= {arXiv preprint arXiv:1702.08892},
year = {2017}
}
备注
NIPS 2017