线性混合 MDP 的离线-在线强化学习
机器学习
2026-04-15 v1 最优化与控制
机器学习
摘要
我们在线性混合马尔可夫决策过程(MDP)中研究离线-在线强化学习,面对环境迁移。在离线阶段,数据由未知的行为策略收集,可能来自不匹配的环境;而在在线阶段,学习者与目标环境交互。我们提出了一种算法,能适应性地利用离线数据。当离线数据具有信息性(例如由于充分的覆盖或小的环境迁移)时,该算法可在纯在线学习之上实现提升。当离线数据缺乏信息时,它会安全地忽略这些数据,匹配仅用的在线学习性能。我们建立了 regret 上界,显式刻画了离线数据何时有益,并给出接近的下界。数值实验进一步支持了我们的理论结论。
引用
@article{arxiv.2604.11994,
title = {Offline-Online Reinforcement Learning for Linear Mixture MDPs},
author = {Zhongjun Zhang and Sean R. Sinclair},
journal= {arXiv preprint arXiv:2604.11994},
year = {2026}
}
备注
72 pages, 4 figures