中文

具有历史依赖动态上下文的强化学习

机器学习 2023-05-19 v2 人工智能 系统与控制 系统与控制 机器学习

摘要

我们引入了动态上下文马尔可夫决策过程(DCMDPs),这是一个新颖的强化学习框架,用于处理历史依赖的环境,它将上下文MDP框架推广到处理上下文随时间变化的非马尔可夫环境。我们考虑了该模型的特殊情况,重点关注逻辑斯谛DCMDPs,它通过利用聚合函数来确定上下文转移,从而打破了对历史长度的指数依赖。这种特殊的结构使我们能够推导出一种基于上置信界的算法,并为其建立了遗憾界。受理论结果的启发,我们为逻辑斯谛DCMDPs引入了一种实用的基于模型的算法,该算法在潜在空间中进行规划,并对历史依赖特征使用乐观性。我们在一个推荐任务(使用MovieLens数据)上展示了我们方法的有效性,其中用户行为动态会随着推荐而演变。

关键词

引用

@article{arxiv.2302.02061,
  title  = {Reinforcement Learning with History-Dependent Dynamic Contexts},
  author = {Guy Tennenholtz and Nadav Merlis and Lior Shani and Martin Mladenov and Craig Boutilier},
  journal= {arXiv preprint arXiv:2302.02061},
  year   = {2023}
}

备注

Published in ICML 2023