中文

离线强化学习中的权衡自动适配

机器学习 2023-06-19 v1

摘要

近来,已有一些在运行时保持自适应能力的离线 RL 算法被提出。例如,LION 算法 \cite{lion} 为用户提供了一个接口,可在运行时设定行为克隆与相对于估计回报的最优性之间的权衡。专家随后可利用该接口根据其偏好调整策略行为,并在保守性与性能优化之间找到良好权衡。由于专家时间宝贵,我们扩展了该方法,加入一个可自动找到正确权衡参数化的自动驾驶模块,从而得到一种新算法,我们称之为 AutoLION。

关键词

引用

@article{arxiv.2306.09744,
  title  = {Automatic Trade-off Adaptation in Offline RL},
  author = {Phillip Swazinna and Steffen Udluft and Thomas Runkler},
  journal= {arXiv preprint arXiv:2306.09744},
  year   = {2023}
}

备注

Oral Presentation @ ESANN 2023