中文

坏策略密度:一种强化学习难度的度量

机器学习 2021-10-08 v1 人工智能

摘要

强化学习一般而言是困难的。然而,在许多特定环境中,学习是容易的。是什么使学习在一个环境中容易,而在另一个环境中困难?我们通过提出一种称为坏策略密度(bad-policy density)的简易强化学习难度度量来解决此问题。该量度量了确定性平稳策略空间中低于给定价值阈值的部分所占比例。我们证明这一简单量具有人们期望于学习难度度量的诸多性质。进一步,我们证明一般情况下计算该度量是 NP-hard 的,但存在多项式时间近似的路径。最后我们总结了该度量的潜在方向与应用。

关键词

引用

@article{arxiv.2110.03424,
  title  = {Bad-Policy Density: A Measure of Reinforcement Learning Hardness},
  author = {David Abel and Cameron Allen and Dilip Arumugam and D. Ellis Hershkowitz and Michael L. Littman and Lawson L. S. Wong},
  journal= {arXiv preprint arXiv:2110.03424},
  year   = {2021}
}

备注

Presented at the 2021 ICML Workshop on Reinforcement Learning Theory