受监控的马尔可夫决策过程
机器学习
2024-02-15 v2
摘要
在强化学习(RL)中,智能体通过与环境交互并接收其动作的反馈(数值奖励)来学习执行任务。然而,奖励总是可观测的假设在现实世界问题中通常不适用。例如,智能体可能需要请求人类监督其动作或启动监控系统以接收反馈。在奖励变为可观测之前可能存在一段时间延迟,或者在一段时间之后不再给予奖励。换言之,存在环境根据智能体的动作产生奖励但智能体无法观测到这些奖励的情况。本文形式化了一个新颖但通用的 RL 框架——受监控的 MDP,其中智能体不能总是观测到奖励。我们讨论了该设定的理论与实践后果,展示了即使在简单环境中也会引发的挑战,并提出了初步解决这一新设定的算法。本文引入了一个强大的新形式化体系,涵盖了新的和现有的问题,并为未来的研究奠定了基础。
引用
@article{arxiv.2402.06819,
title = {Monitored Markov Decision Processes},
author = {Simone Parisi and Montaser Mohammedalamen and Alireza Kazemipour and Matthew E. Taylor and Michael Bowling},
journal= {arXiv preprint arXiv:2402.06819},
year = {2024}
}
备注
AAMAS 2024, Main Track