中文

带终止者的强化学习

机器学习 2023-10-09 v2 人工智能

摘要

我们提出外生终止下的强化学习问题。我们定义了终止马尔可夫决策过程(TerMDP),它是 MDP 框架的扩展,其中片段可能被外部非马尔可夫观测者中断。该表述涵盖了众多现实情形,例如人类因不适感而中断自动驾驶智能体。我们学习了 TerMDP 的参数,并利用估计问题的结构提供状态-wise 置信界。我们利用这些构造了一种可证明高效的、考虑终止的算法,并界定了其后悔值。受理论分析启发,我们设计并实现了一个可扩展方法,该方法结合了(关于终止的)乐观主义与融入终止概率的动态折扣因子。我们将该方法部署于高维驾驶与 MinAtar 基准上。此外,我们在驾驶场景中基于人类数据测试了我们的方法。我们的结果展示了快速收敛以及对各类基线方法的显著改进。

关键词

引用

@article{arxiv.2205.15376,
  title  = {Reinforcement Learning with a Terminator},
  author = {Guy Tennenholtz and Nadav Merlis and Lior Shani and Shie Mannor and Uri Shalit and Gal Chechik and Assaf Hallak and Gal Dalal},
  journal= {arXiv preprint arXiv:2205.15376},
  year   = {2023}
}

备注

NeurIPS 2022