ConQUR:缓解深度Q学习中的妄想偏差
机器学习
2020-03-02 v1 人工智能
机器学习
摘要
妄想偏差是近似Q学习中的基本误差来源。迄今为止,唯一明确解决妄想的方法需要利用表格值估计进行全面搜索。在本文中,我们通过训练Q近似器使用与底层贪婪策略类“一致”的标签,来开发缓解妄想偏差的高效方法。我们引入一种简单的惩罚方案,鼓励跨训练批次使用的Q标签保持(联合)与可表达策略类一致。我们还提出一个搜索框架,允许生成并跟踪多个Q近似器,从而缓解过早(隐式)策略承诺的影响。实验结果表明,这些方法可以在多种Atari游戏中提升Q学习的性能,有时是显著提升。
引用
@article{arxiv.2002.12399,
title = {ConQUR: Mitigating Delusional Bias in Deep Q-learning},
author = {Andy Su and Jayden Ooi and Tyler Lu and Dale Schuurmans and Craig Boutilier},
journal= {arXiv preprint arXiv:2002.12399},
year = {2020}
}