中文

随机长度情节MDP上蒙特卡洛UCB的收敛性

机器学习 2025-03-18 v2 人工智能

摘要

在强化学习中,蒙特卡洛算法通过对情节回报取平均来更新Q函数。在蒙特卡洛UCB(MC-UCB)算法中,每个状态下采取的动作是使Q函数加上上置信界(UCB)探索项最大化的动作,该项使动作选择偏向那些被较少频繁选择的动作。尽管在建立MC-UCB后悔界方面已有大量工作,但多数集中于该问题的有限时域版本,即每个情节在常数步数后终止。对于此类有限时域问题,最优策略同时依赖于当前状态与情节内时间。然而,对于许多自然的情节问题,如围棋、国际象棋等游戏以及机器人任务,情节长度为随机且最优策略是平稳的。对于此类环境,MC-UCB中的Q函数是否会收敛到最优Q函数仍是一个开放问题;我们猜想,与Q-learning不同,它并非对所有MDP都收敛。尽管如此,我们证明对于一大类MDP(包括如二十一点之类的随机MDP与如围棋之类的确定性MDP),MC-UCB中的Q函数几乎必然收敛到最优Q函数。该结果的一个直接推论是,它对所有有限时域MDP也几乎必然收敛。我们还提供了数值实验,以进一步洞察MC-UCB。

关键词

引用

@article{arxiv.2209.02864,
  title  = {On the Convergence of Monte Carlo UCB for Random-Length Episodic MDPs},
  author = {Zixuan Dong and Che Wang and Keith Ross},
  journal= {arXiv preprint arXiv:2209.02864},
  year   = {2025}
}

备注

16 pages, preliminary work