具有外生状态与奖励的强化学习
机器学习
2026-01-15 v2 人工智能
机器学习
摘要
外生状态变量和奖励会通过向奖励信号中注入不受控的变化而减慢强化学习。本文形式化了外生状态变量与奖励,并表明若奖励函数可加性地分解为内生和外生分量,则该 MDP 可分解为一个外生马尔可夫奖励过程(基于外生奖励)和一个内生马尔可夫决策过程(优化内生奖励)。内生 MDP 的任意最优策略也是原 MDP 的最优策略,但由于内生奖励通常具有更小的方差,内生 MDP 更易求解。我们研究了状态空间到外生和内生状态空间的分解未给定而必须被发现的设定。本文引入并证明了当外生与内生子空间通过线性组合混合时,发现状态空间的外生和内生子空间的算法的正确性。这些算法可在强化学习过程中应用,以发现外生子空间、去除外生奖励,并使强化学习聚焦于内生 MDP。在多种具有挑战性的合成 MDP 上的实验表明,这些在线应用的方法能发现大的外生状态空间,并带来强化学习的显著加速。
引用
@article{arxiv.2303.12957,
title = {Reinforcement Learning with Exogenous States and Rewards},
author = {George Trimponias and Thomas G. Dietterich},
journal= {arXiv preprint arXiv:2303.12957},
year = {2026}
}
备注
Substantial rewrite to improve rigor and clarity in response to referee reports at JMLR