迁移 Q 学习
机器学习
2025-10-21 v2 统计方法学
摘要
时间非齐次有限时域马尔可夫决策过程(MDP)常被用于对动态治疗方案和其他统计强化学习场景中的决策进行建模。这些领域,尤其是医疗保健和商业,经常面临诸如高维状态空间和 MDP 过程的时间非齐次性等挑战,加之样本不足,使得知情决策变得复杂。为了克服这些挑战,我们通过利用来自目标强化学习任务和几个相关源任务的数据,研究了时间非齐次有限时域 MDP 中的知识迁移。我们开发了适用于批量和在线 学习的迁移学习算法,整合了来自离线源研究的宝贵见解。所提出的迁移 学习算法包含一个新颖的重新定位步骤,该步骤除了实现监督学习中常见的跨任务迁移外,还能在强化学习任务的多个阶段之间实现跨阶段迁移。我们通过展示离线强化学习迁移中 函数估计的更快速收敛速度,以及在任务间阶段奖励相似性和温和设计相似性条件下,离线到在线强化学习迁移中更低的遗憾界,首次建立了强化学习任务中迁移学习的理论依据。我们提供了来自合成数据集和真实数据集的实证证据,以评估所提出的算法并支持我们的理论结果。
引用
@article{arxiv.2202.04709,
title = {Transfer Q-learning},
author = {Elynn Chen and Sai Li and Michael I. Jordan},
journal= {arXiv preprint arXiv:2202.04709},
year = {2025}
}