低切换成本强化学习的基准测试
机器学习
2021-12-14 v1
摘要
在许多实际强化学习(RL)应用中,包括医疗治疗、推荐系统、教育和机器人技术,一个普遍要求是实际与环境交互的已部署策略不能频繁改变。这种RL设置被称为低切换成本RL,即在减少训练期间策略切换次数的同时实现最高奖励。尽管近期理论研究趋势旨在设计具有可证明效率的低切换成本RL算法,现有方法均未在流行的RL测试平台中得到充分评估。本文中,我们系统研究了一系列策略切换方法,包括理论引导准则、基于策略差异的方法和非自适应基线。通过在医疗治疗环境、Atari游戏和机器人控制任务上的大量实验,我们提出了首个低切换成本RL的实证基准,并报告了关于如何在保持与无低切换成本约束情况相似样本效率的同时降低切换成本的新发现。我们希望该基准能作为开发更具实际效力的低切换成本RL算法的起点。我们在 https://sites.google.com/view/low-switching-cost-rl 发布了代码与完整结果。
引用
@article{arxiv.2112.06424,
title = {A Benchmark for Low-Switching-Cost Reinforcement Learning},
author = {Shusheng Xu and Yancheng Liang and Yunfei Li and Simon Shaolei Du and Yi Wu},
journal= {arXiv preprint arXiv:2112.06424},
year = {2021}
}
备注
17 pages, 5 fiugres, project website: https://sites.google.com/view/low-switching-cost-rl