DisCor:通过分布校正实现强化学习中的纠正性反馈
机器学习
2020-03-17 v1 机器学习
摘要
深度强化学习能够为广泛任务学习有效策略,但因不稳定性和对超参数的敏感性而 notoriously 难以使用。其原因仍不清楚。当使用标准监督方法(例如用于 bandit)时,同策略数据收集提供了“难负样本”,可在策略可能访问的那些状态与动作上精确纠正模型。我们称此现象为“纠正性反馈”。我们表明,基于 bootstrap 的 Q-learning 算法未必受益于这种纠正性反馈,且对算法所收集经验进行训练不足以纠正 Q 函数中的错误。事实上,Q-learning 及相关方法会表现出智能体所收集经验分布与在该经验上训练所诱导策略之间的病态交互,导致在不稳定、次优收敛以及从噪声、稀疏或延迟奖励中学习时结果不佳。我们从理论和经验上证明了该问题的存在。随后我们表明,对数据分布进行特定校正可缓解此问题。基于这些观察,我们提出一种新算法 DisCor,其计算该最优分布的近似并用它重新加权用于训练的转移,从而在一系列具有挑战性的 RL 设定(如多任务学习和从噪声奖励信号中学习)中取得实质性改进。总结本工作的博客文章见:https://bair.berkeley.edu/blog/2020/03/16/discor/。
引用
@article{arxiv.2003.07305,
title = {DisCor: Corrective Feedback in Reinforcement Learning via Distribution Correction},
author = {Aviral Kumar and Abhishek Gupta and Sergey Levine},
journal= {arXiv preprint arXiv:2003.07305},
year = {2020}
}
备注
Pre-print