主动推断与强化学习:部分可观测下连续状态与动作空间的统一推断框架
机器学习
2024-06-03 v3 人工智能
摘要
强化学习(RL)因开发在完全可观测环境中最大化由外部监督者指定奖励的决策智能体而受到广泛关注。然而,许多现实世界问题涉及部分观测,被表述为部分可观测马尔可夫决策过程(POMDPs)。先前研究通过在 POMDPs 中融入过去动作与观测的记忆,或从观测数据推断环境真实状态来解决 RL 问题。然而,在连续空间中随时间聚合观测数据变得不切实际。此外,基于推断的 RL 方法通常需要大量样本才能表现良好,因为它们仅关注奖励最大化而忽略推断状态中的不确定性。主动推断(AIF)是在 POMDPs 中构建的框架,指导智能体通过最小化称为期望自由能(EFE)的函数来选择动作。这在 RL 中提供了奖励最大化(利用)行为与信息寻求(探索)行为。尽管 AIF 具有这种探索行为,但由于与 EFE 相关的计算挑战,其使用仅限于离散空间。在本文中,我们提出了一种统一原理,建立 AIF 与 RL 之间的理论联系,使这两种方法无缝集成,并克服它们在连续空间 POMDP 设定中的上述局限。我们通过理论分析证实发现,为在人工智能体设计中利用 AIF 提供新视角。实验结果展示了我们的方法在解决连续空间部分可观测任务中的优越学习能力。值得注意的是,我们的方法利用信息寻求探索,使其能有效解决无奖励问题,并使外部监督者的显式任务奖励设计变为可选。
引用
@article{arxiv.2212.07946,
title = {Active Inference and Reinforcement Learning: A unified inference on continuous state and action spaces under partial observability},
author = {Parvin Malekzadeh and Konstantinos N. Plataniotis},
journal= {arXiv preprint arXiv:2212.07946},
year = {2024}
}
备注
90 pages including appendices