具有 loglog(T) 切换成本的样本高效强化学习
机器学习
2022-06-07 v2 人工智能
机器学习
摘要
我们研究具有低(策略)切换成本的强化学习(RL)问题——该问题由实际 RL 应用充分驱动,其中部署新策略代价高昂且策略更新次数必须很少。本文中,我们提出一种基于阶段式探索与自适应策略消除的新算法,在要求 切换成本的同时实现 的悔值。相较于现有具有 悔值方法中已知最优的 切换成本,这是指数级改进。上述中, 表示未知转移的 步幕式马尔可夫决策过程模型中的状态数与动作数, 为步数。作为新技术的副产品,我们还推导了切换成本为 的无奖励探索算法。此外,我们证明了一对信息论下界: (1) 任何无悔值算法必须具有 的切换成本;(2) 任何 悔值算法必须承受 的切换成本。因此我们的两种算法在其切换成本上均为最优。
引用
@article{arxiv.2202.06385,
title = {Sample-Efficient Reinforcement Learning with loglog(T) Switching Cost},
author = {Dan Qiao and Ming Yin and Ming Min and Yu-Xiang Wang},
journal= {arXiv preprint arXiv:2202.06385},
year = {2022}
}
备注
44 pages, 1 figure