中文

缓慢演化潜状态环境中的优势放大

机器学习 2019-06-03 v1 人工智能 机器学习

摘要

具有长时域的潜状态环境,例如推荐系统所面临的那些,给强化学习(RL)带来了重大挑战。在本工作中,我们识别并分析了此类环境中 RL 所面临的若干关键障碍,包括信念状态误差与微小的动作优势。我们提出了一种优势放大的一般性原理,可通过时间抽象克服这些障碍。我们提出了几种聚合方法,并证明它们在特定设定下能诱导放大。我们还对方法在潜状态缓慢演化的环境中带来的最优性损失给出了界,并在一个程式化的用户建模任务中实证展示了其性能。

关键词

引用

@article{arxiv.1905.13559,
  title  = {Advantage Amplification in Slowly Evolving Latent-State Environments},
  author = {Martin Mladenov and Ofer Meshi and Jayden Ooi and Dale Schuurmans and Craig Boutilier},
  journal= {arXiv preprint arXiv:1905.13559},
  year   = {2019}
}