中文

基于迁移感知上置信界的Q学习:非平稳强化学习中的探索与利用权衡

机器学习 2026-03-31 v2

摘要

我们研究了在分布迁移下的非平稳强化学习问题,涵盖有限时长的无限纳希尔蒙过程(MDP)和无限时长的折扣MDP。在有限时长情况下,转换函数可能在特定回合突然变化。在无限时长设置下,这种变化可以在与环境交互的任意时间步骤发生。虽然Q学习上置信界算法(QUCB)能够在学习期间发现合适的策略,但由于分布迁移,该策略在迁移发生后可能利用次优奖励。为此,我们提出了密度增强型Q学习上置信界算法(DQUCB),一种具备迁移感知能力的Q学习UCB算法。该算法利用转换密度函数检测分布迁移,并据此利用其似然性来提高Q学习UCB不确定性估计的质量,从而在探索与利用之间实现平衡。理论上,我们证明了oracle DQUCB的情期损失保证优于QUCB。实验方面,我们的DQUCB保留了无模型强化学习的计算效率,同时在多个RL任务中实现更低的情期损失,以及在深度Q学习架构下的COVID-19患者医疗资源分配任务中表现优异。

关键词

引用

@article{arxiv.2510.03181,
  title  = {Q-Learning with Shift-Aware Upper Confidence Bound in Non-Stationary Reinforcement Learning},
  author = {Ha Manh Bui and Felix Parker and Kimia Ghobadi and Anqi Liu},
  journal= {arXiv preprint arXiv:2510.03181},
  year   = {2026}
}

备注

International Conference on Artificial Intelligence and Statistics, 2026