从部分可观测马尔可夫决策过程推断奖励机器和转移机器
机器学习
2025-08-05 v1 人工智能
摘要
部分可观测马尔可夫决策过程(POMDPs)是许多实际应用中的基础问题。尽管强化学习(RL)在完全可观测领域取得了成功,但在部分可观测环境中从轨迹中学习策略仍然具有挑战性,因为观察结果是非马尔可夫的。推断用于处理非马尔可夫性质的自动机是一个被证明有效的做法,但面临两个局限性:1)现有的自动机表示仅关注奖励导致的非马尔可夫性质,导致问题表述不自然;2)推断算法面临巨大的计算成本。针对第一个局限性,我们引入转移机器(TMs)来补充现有的奖励机器(RMs)。为了为两种自动机类型开发统一的推断算法,我们提出了单题型双行为机器(DBMM),它涵盖了TMs和RMs。我们进一步引入DB-RPNI,这是一种被动自动机学习算法,能够高效地推断DBMM,而无需先前工作中必需的复杂化简。我们进一步开发了优化技术并确定了推断最小正确自动机的充分条件。实验表明,我们的推断方法相对于SOTA基线可实现最高可达三个数量级的加速。
引用
@article{arxiv.2508.01947,
title = {Inferring Reward Machines and Transition Machines from Partially Observable Markov Decision Processes},
author = {Yuly Wu and Jiamou Liu and Libo Zhang},
journal= {arXiv preprint arXiv:2508.01947},
year = {2025}
}
备注
12 pages, 7 figures. Under review as a conference paper. Source code is available at: https://github.com/sousoura/Inferring-Reward-Machines-and-Transition-Machines-from-POMDP.git