面向深度Q网络的状态感知变分Thompson采样
机器学习
2021-02-09 v1 人工智能
摘要
Thompson采样是强化学习中平衡探索与利用的著名方法。它要求维持价值-动作函数的后验分布;对于具有高维状态-动作空间的任务,这通常是难处理的。我们推导了DQNs的一种变分Thompson采样近似,其使用由所学变分噪声分布扰动的深度网络参数。我们将成功的NoisyNets方法\cite{fortunato2018noisy}解释为对我们所推导变分Thompson采样方法的近似。进一步,我们提出状态感知噪声探索(SANE),旨在通过允许非均匀扰动来改进NoisyNets,其中参数扰动量以智能体状态为条件。这借助一个辅助扰动模块实现,其输出依赖于状态并通过梯度下降端到端学习。我们假设此类状态感知噪声探索在 certain \textit{高风险} 状态下的探索可能导致智能体严重失败的问题中尤为有用。我们通过在离策略设置中用辅助扰动模块增强DQNs,展示了状态感知探索方法的有效性。
引用
@article{arxiv.2102.03719,
title = {State-Aware Variational Thompson Sampling for Deep Q-Networks},
author = {Siddharth Aravindan and Wee Sun Lee},
journal= {arXiv preprint arXiv:2102.03719},
year = {2021}
}