离散动作非马尔可夫奖励决策过程的模型基强化学习
机器学习
2025-12-17 v1 人工智能
摘要
许多实际决策问题涉及其成功取决于整个系统历史,而非实现具有所需属性的状态。马尔可夫强化学习(RL)方法不适用于此类任务,而非马尔可夫奖励决策过程(NMRDPs)的RL则使代理能够处理时间依赖任务。该方法长期以来已知在(近)最优性和样本效率方面缺乏形式保证。我们通过QR-MAX,一种针对离散NMRDPs的新型模型基算法,解决了这两个问题。QR-MAX通过奖励机器对马尔可夫转移学习与非马尔可夫奖励处理进行因子分解,从而获得PAC收敛于最优策略的多项式样本复杂度。我们将QR-MAX扩展到连续状态空间,采用基于SimHash的离散器Bucket-QR-MAX,保持相同的因子分解结构,实现快速稳定的学习,无需手动网格化或函数近似。我们在不断增加复杂性的环境中与现代模型基RL方法进行了实验比较,显示在样本效率和找到最优策略的鲁棒性方面具有显著提升。
引用
@article{arxiv.2512.14617,
title = {Model-Based Reinforcement Learning in Discrete-Action Non-Markovian Reward Decision Processes},
author = {Alessandro Trapasso and Luca Iocchi and Fabio Patrizi},
journal= {arXiv preprint arXiv:2512.14617},
year = {2025}
}
备注
19 pages, 32 figures, includes appendix