深度强化学习中覆盖率的评估与加速
机器学习
2020-12-02 v1 人工智能
摘要
当前深度强化学习(DRL)算法利用仿真环境中的随机性来假设状态空间中的完全覆盖。然而,尤其在高维情况下,依赖随机性可能导致训练所得 DRL 神经网络模型覆盖存在缺口,进而引发严重的、往往是致命的真实世界情形。据作者所知,当前研究文献中缺乏针对 DRL 覆盖的评估。因此,本文提出一种新颖测度——近似伪覆盖(APC),用于评估 DRL 应用中的覆盖率。我们提议通过将高维状态空间投影至低维流形并量化已占据空间来计算 APC。此外,我们利用探索-利用策略,借助快速扩展随机树(RRT)实现覆盖最大化。该评估与覆盖加速的有效性在 Cartpole、highway-env 等标准任务上得到验证。
引用
@article{arxiv.2012.00724,
title = {Assessing and Accelerating Coverage in Deep Reinforcement Learning},
author = {Arpan Kusari},
journal= {arXiv preprint arXiv:2012.00724},
year = {2020}
}