带终止者的强化学习
机器学习
2023-10-09 v2 人工智能
摘要
我们提出外生终止下的强化学习问题。我们定义了终止马尔可夫决策过程(TerMDP),它是 MDP 框架的扩展,其中片段可能被外部非马尔可夫观测者中断。该表述涵盖了众多现实情形,例如人类因不适感而中断自动驾驶智能体。我们学习了 TerMDP 的参数,并利用估计问题的结构提供状态-wise 置信界。我们利用这些构造了一种可证明高效的、考虑终止的算法,并界定了其后悔值。受理论分析启发,我们设计并实现了一个可扩展方法,该方法结合了(关于终止的)乐观主义与融入终止概率的动态折扣因子。我们将该方法部署于高维驾驶与 MinAtar 基准上。此外,我们在驾驶场景中基于人类数据测试了我们的方法。我们的结果展示了快速收敛以及对各类基线方法的显著改进。
引用
@article{arxiv.2205.15376,
title = {Reinforcement Learning with a Terminator},
author = {Guy Tennenholtz and Nadav Merlis and Lior Shani and Shie Mannor and Uri Shalit and Gal Chechik and Assaf Hallak and Gal Dalal},
journal= {arXiv preprint arXiv:2205.15376},
year = {2023}
}
备注
NeurIPS 2022