部分可观测环境中循环网络、隐藏状态与信念
机器学习
2022-09-13 v1 机器学习
摘要
强化学习旨在从与未知动态环境的交互中学习最优策略。许多方法依赖于值函数的逼近以导出近似最优策略。在部分可观测环境中,这些值函数依赖于称为历史的完整观测与过去动作序列。在本文中,我们通过实验表明,经训练以逼近此类值函数的循环神经网络在内部滤波了给定历史下当前状态的后验概率分布,称为信念。更确切地说,我们表明,随着循环神经网络学习 Q-函数,其隐藏状态与同最优控制相关的状态变量的信念之间的相关性越来越强。该相关性通过它们的互信息来度量。此外,我们表明,智能体的期望回报随其循环架构在其隐藏状态与信念之间达到高互信息的能力而增长。最后,我们表明,与最优控制无关的变量的隐藏状态和信念之间的互信息在学习过程中下降。总之,本工作表明,在逼近部分可观测环境的 Q-函数的循环神经网络的隐藏状态中,重现了历史的一个充分统计量,其与用于采取最优动作的信念的相关部分相关联。
引用
@article{arxiv.2208.03520,
title = {Recurrent networks, hidden states and beliefs in partially observable environments},
author = {Gaspard Lambrechts and Adrien Bolland and Damien Ernst},
journal= {arXiv preprint arXiv:2208.03520},
year = {2022}
}
备注
12 pages, 28 pages total, 20 figures. Transactions on Machine Learning Research (2022)