无奖励学习中探索与偏好满足的权衡
人工智能
2021-07-20 v2 神经元与认知
摘要
生物智能体即便在缺乏即时奖励信号的情况下,也能与环境进行有意义的互动。在此类情形下,智能体可以学习导致可预测状态——对生存而言必要——的偏好行为模式。在本文中,我们秉持这样一种观念:这种习得行为可能是无奖励偏好学习的结果,该学习确保了探索与偏好满足之间的恰当权衡。为此,我们引入了一个基于模型的贝叶斯智能体,其配备有使用共轭先验的偏好学习机制(pepper)。这些共轭先验被用于增强期望自由能规划器,以跨时间学习对状态(或结果)的偏好。重要的是,我们的方法使智能体能够在测试时学习有助于适应性行为的偏好。我们在 OpenAI Gym FrozenLake 与 3D mini-world 环境(含与不含波动性)中说明了这一点。在恒定环境下,这些智能体学习到置信的(即精确的)偏好并行动以满足之。反之,在波动性设定中,持续的偏好不确定性维持了探索行为。我们的实验表明,可学习的(无奖励)偏好带来了探索与偏好满足之间的权衡。Pepper 提供了一个直接的框架,适用于在如真实环境中无法预定义奖励函数时设计适应性智能体。
引用
@article{arxiv.2106.04316,
title = {Exploration and preference satisfaction trade-off in reward-free learning},
author = {Noor Sajid and Panagiotis Tigas and Alexey Zakharov and Zafeirios Fountas and Karl Friston},
journal= {arXiv preprint arXiv:2106.04316},
year = {2021}
}
备注
23 pages, 15 figures