中文

用户交互式离线强化学习

机器学习 2023-01-26 v2

摘要

离线强化学习算法在实践中仍缺乏信任,因为所学策略可能比生成数据集的原始策略表现更差,或以用户不熟悉的意外方式行事。同时,离线强化学习算法无法调谐其最重要的超参数——所学策略与原始策略的接近程度。我们提出一种算法,允许用户在运行时调谐该超参数,从而同时解决上述两个问题。这使得用户可以从原始行为出发并逐步允许更大的偏离,也可在策略退化或行为过于偏离熟悉行为时随时停止。

关键词

引用

@article{arxiv.2205.10629,
  title  = {User-Interactive Offline Reinforcement Learning},
  author = {Phillip Swazinna and Steffen Udluft and Thomas Runkler},
  journal= {arXiv preprint arXiv:2205.10629},
  year   = {2023}
}

备注

Accepted at ICLR 2023 - 11th International Conference on Learning Representations