内在机器:基于内在生理奖励的强化学习中的风险规避
人工智能
2019-03-25 v2
摘要
随着人们学会在世界中导航,自主神经系统(例如“战斗或逃跑”)反应提供了关于行动选择潜在后果的内在反馈(例如,在靠近悬崖边缘或在弯道快速行驶时变得紧张)。生理变化与这些保护自身免受危险的生物学准备相关联。我们提出了一种新的强化学习方法,该方法利用在与人类自主神经系统反应相关的外周脉搏测量上训练的、与任务无关的内在奖励函数。我们的假设是,这样的奖励函数可以规避强化学习环境中与稀疏和倾斜奖励相关的挑战,并有助于提高样本效率。我们在模拟驾驶环境中对此进行了测试,并表明它可以提高学习速度并减少学习阶段的碰撞次数。
引用
@article{arxiv.1805.09975,
title = {Visceral Machines: Risk-Aversion in Reinforcement Learning with Intrinsic Physiological Rewards},
author = {Daniel McDuff and Ashish Kapoor},
journal= {arXiv preprint arXiv:1805.09975},
year = {2019}
}