中文

好奇探索者:策略学习中一种可证明的探索策略

机器学习 2021-06-30 v1 人工智能

摘要

能够访问一种探索性的重启分布(即所谓的广泛覆盖假设)对于策略梯度方法至关重要。这是因为,尽管目标函数在不大可能的状态上的更新不敏感,智能体仍可能需要在这些状态上做出改进以达成近最优收益。因此,在分析实用策略梯度方法的理论性质时,会以某种形式使用广泛覆盖假设。然而,该假设在某些环境中可能不可行,例如当学习为在线时,或仅能从固定初始状态重启时。在这些情况下,经典策略梯度算法可能具有很差的收敛性质与样本效率。本文中,我们开发了好奇探索者(Curious Explorer),一种新颖且简单的迭代状态空间探索策略,可与任意起始分布 ρ\rho 配合使用。好奇探索者从 ρ\rho 出发,随后利用分配给访问匮乏状态集的内在奖励产生一系列策略,每个策略相较前一策略以有依据的方式更具探索性,并最终基于探索性策略的状态访问分布输出一个重启模型 μ\mu。好奇探索者是可证明的,在于我们给出了最优策略访问匮乏状态频率的理论上界。当将 PAC 优化器接入好奇探索者时,这些界可用于证明 PAC 收敛与样本效率结果。这得以在无任何覆盖假设下为 REINFORCE 实现全局收敛与样本效率结果,并潜在地适用于任何其他在广泛覆盖下保证 PAC 收敛的策略梯度方法。最后,我们将(好奇探索者的输出)接入 REINFORCE 与 TRPO,并实证表明其能在具有挑战性探索的 MDP 中提升性能。

关键词

引用

@article{arxiv.2106.15503,
  title  = {Curious Explorer: a provable exploration strategy in Policy Learning},
  author = {Marco Miani and Maurizio Parton and Marco Romito},
  journal= {arXiv preprint arXiv:2106.15503},
  year   = {2021}
}