中文

基于贝尔曼-耶斯顿方法的 imperfect transition predictions 强化学习

机器学习 2025-10-22 v1

摘要

传统强化学习 (RL) 假设智能体基于具有单步转移模型的马尔可夫决策过程 (MDP) 做出决策。在许多实际应用中,例如能源管理和股票投资,智能体可以获取未来状态的多步预测,这为决策提供了额外的优势。然而,多步预测本质上是高维的: naively 将这些预测嵌入 MDP 会导致状态空间呈指数级膨胀并陷入维度灾难。此外,现有的 RL 理论提供的少数工具无法分析带有预测的 MDP,因为它通常只适用于单步转移核,无法容纳带有误差或部分动作覆盖的多步预测。我们通过三个关键创新来解决这些挑战:首先,我们提出了 \emph{贝叶斯价值函数} 来可扩展地特征化最优 prediction-aware 策略。其次,我们在贝叶斯价值函数上开发了一种新的 \emph{贝尔曼-耶斯顿间隙} 分析,这使得能够特征化不完美预测的价值。第三,我们引入 BOLA (贝叶斯离线学习伴随在线适应),一种两阶段基于模型的 RL 算法,将离线贝叶斯价值学习与针对 real-time 预测的轻量级在线适应分离。我们证明了即使在不完美预测下,BOLA 也保持 sample-efficient。我们在合成 MDP 和一个真实世界的风能储存控制问题上验证了我们的理论和算法。

关键词

引用

@article{arxiv.2510.18687,
  title  = {Reinforcement Learning with Imperfect Transition Predictions: A Bellman-Jensen Approach},
  author = {Chenbei Lu and Zaiwei Chen and Tongxin Li and Chenye Wu and Adam Wierman},
  journal= {arXiv preprint arXiv:2510.18687},
  year   = {2025}
}