通过后视可观测 POMDP 中的部分监督强化学习习得可解释策略
机器学习
2024-02-15 v1 人工智能
摘要
深度强化学习在视频游戏、机器人控制、自动驾驶和药物发现等多个领域取得了显著成就。部分可观测领域的常用方法主要依赖于从图像等高维观测数据进行端到端学习,而未对真实状态进行显式推理。我们提出了一种替代方向,引入了部分监督强化学习(Partially Supervised Reinforcement Learning, PSRL)框架。PSRL 的核心在于融合监督学习与无监督学习。该方法利用状态估计器,从通常在训练时完全可观测的高维观测数据中提取监督语义状态信息。这产生了更具可解释性的策略,将状态预测与控制相结合。同时,它捕捉无监督的潜在表示。随后,这两个部分——语义状态和潜在状态——被融合作为策略网络的输入。这种并置为从业者提供了一个灵活且动态的谱系:从强调监督状态信息到整合更丰富的潜在洞察。广泛的实验结果表明,通过合并这两种表示,PSRL 提供了一种强有力的平衡,在增强模型可解释性的同时,保持并通常在奖励和收敛速度方面显著超越传统方法设定的性能基准。
引用
@article{arxiv.2402.09290,
title = {Learning Interpretable Policies in Hindsight-Observable POMDPs through Partially Supervised Reinforcement Learning},
author = {Michael Lanier and Ying Xu and Nathan Jacobs and Chongjie Zhang and Yevgeniy Vorobeychik},
journal= {arXiv preprint arXiv:2402.09290},
year = {2024}
}