中文

超越线性MDP的强化学习中对数量级切换代价

机器学习 2023-02-27 v1 人工智能 机器学习

摘要

在许多实际强化学习(RL)问题中,部署新策略代价高昂。此类场景下,算法须在稀疏切换所部署策略(限制适应性)的同时解决探索问题(需要适应性)。本文超越现有聚焦于线性马尔可夫决策过程(MDPs)的该问题最优研究,考虑具有低固有Bellman误差的线性Bellman完全MDPs。我们提出ELEANOR-LowSwitching算法,以关于回合数的对数、时间范围HH和特征维度dd的线性的切换代价实现近最优后悔界。我们还证明了在所有具有次线性后悔的算法中,下界与dHdH成正比。此外,我们展示了ELEANOR-LowSwitching中使用的“倍增技巧”可进一步用于广义线性函数近似,据此设计了具有近最优切换代价的样本高效算法。

关键词

引用

@article{arxiv.2302.12456,
  title  = {Logarithmic Switching Cost in Reinforcement Learning beyond Linear MDPs},
  author = {Dan Qiao and Ming Yin and Yu-Xiang Wang},
  journal= {arXiv preprint arXiv:2302.12456},
  year   = {2023}
}

备注

25 pages