基于动作的期望回报方差识别关键状态
机器学习
2020-11-10 v2 机器学习
摘要
探索与利用的平衡在加速强化学习(RL)中起着至关重要的作用。将 RL 智能体部署到人类社会中时,其可解释性也必不可少。然而,基础 RL 方法难以决定何时选择利用,也难以提取有用要点以简要解释其运行过程。造成这些困难的一个原因是这些方法对所有状态一视同仁。在此,我们表明识别关键状态并对其进行特殊处理对这两个问题普遍有益。这些关键状态是指动作选择会显著改变成功与失败可能性的状态。我们提出利用 Q 函数关于动作的方差来识别关键状态,并在所识别的状态上以高概率执行利用。这些简单方法在带悬崖的网格世界和两个深度 RL 基准任务中加速了 RL。我们的结果还表明,所识别的关键状态在动作选择的关键性质方面具有直观可解释性。此外,我们对特别关键状态的识别时机与学习快速进展之间关系的分析表明,存在少数特别关键的状态,它们含有用于快速加速 RL 的重要信息。
引用
@article{arxiv.2008.11332,
title = {Identifying Critical States by the Action-Based Variance of Expected Return},
author = {Izumi Karino and Yoshiyuki Ohmura and Yasuo Kuniyoshi},
journal= {arXiv preprint arXiv:2008.11332},
year = {2020}
}
备注
12 pages, 6 figures