面向自调节自主智能体的连续稳态强化学习
人工智能
2021-09-15 v1
摘要
稳态是生物维持其内环境于最优水平附近的普遍过程。多方面证据表明,生物学习采取行动以预测性地确保稳态(异态稳态)。此类调节的一个经典理论是驱力降低,即当前与最优内部状态之差的函数。近期提出的稳态调节强化学习理论(HRRL)通过在强化学习框架内基于智能体内部状态定义奖励函数,建立了驱力降低理论与强化学习理论之间的联系。HRRL 能够解释多种进食障碍。然而,离散时间建模下智能体内部状态缺乏连续变化一直是 HRRL 理论的关键缺陷。在此,我们提出将稳态强化学习理论扩展至时空连续环境,同时保持该模型在离散时间下的理论结果与被解释行为的有效性。受生物学中大量存在的自调节机制启发,我们还引入了智能体内部状态动力学模型,要求智能体持续采取行动以维持稳态。基于 Hamilton-Jacobi-Bellman 方程与神经网络函数逼近,我们推导出一种数值方案,使智能体直接学习其内部机制如何运作,并通过强化学习及对环境的恰当探索选择适当行动策略。我们的数值实验表明,智能体确实学习到有益于其在环境中生存的行为方式,使我们的框架在建模动物动力学与决策方面具有前景。
引用
@article{arxiv.2109.06580,
title = {Continuous Homeostatic Reinforcement Learning for Self-Regulated Autonomous Agents},
author = {Hugo Laurençon and Charbel-Raphaël Ségerie and Johann Lussange and Boris S. Gutkin},
journal= {arXiv preprint arXiv:2109.06580},
year = {2021}
}