超越线性MDP的强化学习中对数量级切换代价
机器学习
2023-02-27 v1 人工智能
机器学习
摘要
在许多实际强化学习(RL)问题中,部署新策略代价高昂。此类场景下,算法须在稀疏切换所部署策略(限制适应性)的同时解决探索问题(需要适应性)。本文超越现有聚焦于线性马尔可夫决策过程(MDPs)的该问题最优研究,考虑具有低固有Bellman误差的线性Bellman完全MDPs。我们提出ELEANOR-LowSwitching算法,以关于回合数的对数、时间范围和特征维度的线性的切换代价实现近最优后悔界。我们还证明了在所有具有次线性后悔的算法中,下界与成正比。此外,我们展示了ELEANOR-LowSwitching中使用的“倍增技巧”可进一步用于广义线性函数近似,据此设计了具有近最优切换代价的样本高效算法。
引用
@article{arxiv.2302.12456,
title = {Logarithmic Switching Cost in Reinforcement Learning beyond Linear MDPs},
author = {Dan Qiao and Ming Yin and Yu-Xiang Wang},
journal= {arXiv preprint arXiv:2302.12456},
year = {2023}
}
备注
25 pages