基于自由能原理的观测噪声无害探索内在奖励:强化学习中的仿真研究
机器学习
2024-05-14 v1 机器学习
摘要
在强化学习(RL)中,人工智能体通过执行任务来最大化数值奖励。由于在利用之前必须发现信息,探索对于 RL 至关重要。entropy 和信息获取好奇心是两种鼓励高效探索的奖励。entropy 在文献中已广泛认可,促进随机动作选择;好奇心以多种方式在文献中被定义,促进发现新经验。一种示例是 prediction error 好奇心,对无法准确预测的观测结果给予奖励。然而,这类智能体可能被称为好奇陷阱的不可预测观测噪声所干扰。基于自由能原理(FEP),本文提出了隐藏状态好奇心,该方法通过潜在变量的预测先验概率与后验概率之间的 KL 散度为智能体提供奖励。我们训练了六种类型的智能体在迷宫中导航:baseline 无 entropy 或好奇心奖励的智能体,以及奖励 entropy 和/或 prediction error 好奇心或隐藏状态好奇心的智能体。我们发现 entropy 和好奇心结果有效的探索,尤其是两者一起使用时效果更佳。值得注意的是,具有隐藏状态好奇心的智能体对好奇陷阱具有韧性,而 prediction error 好奇心的智能体则受到阻碍。这表明实施 FEP 可能增强 RL 模型的鲁棒性和泛化能力, potentially 将人工智能体的学习过程与生物智能体的学习过程对齐。
引用
@article{arxiv.2405.07473,
title = {Intrinsic Rewards for Exploration without Harm from Observational Noise: A Simulation Study Based on the Free Energy Principle},
author = {Theodore Jerome Tinker and Kenji Doya and Jun Tani},
journal= {arXiv preprint arXiv:2405.07473},
year = {2024}
}
备注
54 pages, 11 figures, to be published in Neural Computation