受监控马尔可夫决策过程中的泛化
人工智能
2025-05-15 v1
摘要
强化学习(RL)通常将智能体与环境的相互作用建模为马尔可夫决策过程(MDP),其中指导智能体行为的奖励始终是可观测的。然而,在许多实际场景中,奖励并非始终可观测,这类情况可建模为受监控马尔可夫决策过程(Mon-MDP)。目前针对Mon-MDP的工作仅限于简单的表格化情况,限制了其在实际问题中的应用范围。本文使用函数逼近(FA)探索Mon-MDP,并研究其面临的挑战。我们表明,结合函数逼近与学习的奖励模型后,智能体能够从具有可观测奖励的受监控状态,泛化到具有不可观测奖励的环境状态。因此,我们展示了这种基于奖励模型的泛化策略在形式上定义为不可解环境中实现近最优政策。然而,我们识别出这种函数逼近的关键局限性,即智能体因过度泛化而错误地外推奖励,从而导致不理想的行为。为缓解过度泛化,我们提出了一种利用奖励不确定性的谨慎政策优化方法。本文为弥合Mon-MDP理论与实际应用之间的鸿沟提供了一步步进。
引用
@article{arxiv.2505.08988,
title = {Generalization in Monitored Markov Decision Processes (Mon-MDPs)},
author = {Montaser Mohammedalamen and Michael Bowling},
journal= {arXiv preprint arXiv:2505.08988},
year = {2025}
}
备注
Under Review