离线强化学习中的权衡自动适配
机器学习
2023-06-19 v1
摘要
近来,已有一些在运行时保持自适应能力的离线 RL 算法被提出。例如,LION 算法 \cite{lion} 为用户提供了一个接口,可在运行时设定行为克隆与相对于估计回报的最优性之间的权衡。专家随后可利用该接口根据其偏好调整策略行为,并在保守性与性能优化之间找到良好权衡。由于专家时间宝贵,我们扩展了该方法,加入一个可自动找到正确权衡参数化的自动驾驶模块,从而得到一种新算法,我们称之为 AutoLION。
引用
@article{arxiv.2306.09744,
title = {Automatic Trade-off Adaptation in Offline RL},
author = {Phillip Swazinna and Steffen Udluft and Thomas Runkler},
journal= {arXiv preprint arXiv:2306.09744},
year = {2023}
}
备注
Oral Presentation @ ESANN 2023