中文

基于价值序贯决策的逆策略评估

机器学习 2020-08-27 v1 人工智能

摘要

基于价值的强化学习方法普遍缺乏从价值函数导出行为的通用方式。许多方法涉及近似价值迭代(例如 QQ 学习),并相对于估计值以任意程度的熵贪婪行动,以确保状态空间被充分探索。基于显式贪婪化的行为假设价值反映了某策略的价值,而贪婪策略将相对于该策略有所改进。然而,价值迭代可能产生不对应于任何策略的价值函数。这在函数逼近机制下尤为相关,因为真实价值函数无法被完美表示。在本工作中,我们探索使用逆策略评估(即给定价值函数求解可能策略的过程)来从价值函数导出行为。我们提供理论与经验结果,表明逆策略评估与近似价值迭代算法相结合,是基于价值的控制的可行方法。

关键词

引用

@article{arxiv.2008.11329,
  title  = {Inverse Policy Evaluation for Value-based Sequential Decision-making},
  author = {Alan Chan and Kris de Asis and Richard S. Sutton},
  journal= {arXiv preprint arXiv:2008.11329},
  year   = {2020}
}

备注

Submitted to NeurIPS 2020