中文

具有 loglog(T) 切换成本的样本高效强化学习

机器学习 2022-06-07 v2 人工智能 机器学习

摘要

我们研究具有低(策略)切换成本的强化学习(RL)问题——该问题由实际 RL 应用充分驱动,其中部署新策略代价高昂且策略更新次数必须很少。本文中,我们提出一种基于阶段式探索与自适应策略消除的新算法,在要求 O(HSAloglogT)O(HSA \log\log T) 切换成本的同时实现 O~(H4S2AT)\widetilde{O}(\sqrt{H^4S^2AT}) 的悔值。相较于现有具有 O~(poly(H,S,A)T)\widetilde{O}(\mathrm{poly}(H,S,A)\sqrt{T}) 悔值方法中已知最优的 O(H2SAlogT)O(H^2SA\log T) 切换成本,这是指数级改进。上述中,S,AS,A 表示未知转移的 HH 步幕式马尔可夫决策过程模型中的状态数与动作数,TT 为步数。作为新技术的副产品,我们还推导了切换成本为 O(HSA)O(HSA) 的无奖励探索算法。此外,我们证明了一对信息论下界: (1) 任何无悔值算法必须具有 Ω(HSA)\Omega(HSA) 的切换成本;(2) 任何 O~(T)\widetilde{O}(\sqrt{T}) 悔值算法必须承受 Ω(HSAloglogT)\Omega(HSA\log\log T) 的切换成本。因此我们的两种算法在其切换成本上均为最优。

关键词

引用

@article{arxiv.2202.06385,
  title  = {Sample-Efficient Reinforcement Learning with loglog(T) Switching Cost},
  author = {Dan Qiao and Ming Yin and Ming Min and Yu-Xiang Wang},
  journal= {arXiv preprint arXiv:2202.06385},
  year   = {2022}
}

备注

44 pages, 1 figure