带情绪地玩:情感驱动的强化学习
机器学习
2022-08-29 v1 人工智能
人机交互
摘要
本文通过将情感建模任务视为强化学习(RL)过程,引入了范式转变。根据所提范式,RL智能体通过尝试在与环境(即上下文)的交互中最大化一组奖励(即行为与情感模式)来学习策略(即情感交互)。我们的假设是,RL是一种将情感诱发与表达同行为与情感示范交织起来的有效范式。重要的是,我们的第二个假设——基于达马西奥的躯体标记假说——是情绪可以成为决策的促进者。我们在一个竞速游戏中检验了我们的假设,通过训练Go-Blend智能体来建模人类唤醒与行为的示范;Go-Blend是Go-Explore算法的改进版本,该算法近期在困难探索任务中展现了卓越性能。我们首先改变基于唤醒的奖励函数,观察到智能体能够根据指定奖励有效展示一系列情感与行为模式。随后我们使用基于唤醒的状态选择机制来偏置Go-Blend所探索的策略。我们的发现表明,Go-Blend不仅是一种高效的情感建模范式,更重要的是,情感驱动的RL改善了探索并产生了性能更高的智能体,从而在游戏领域验证了达马西奥的假说。
引用
@article{arxiv.2208.12622,
title = {Play with Emotion: Affect-Driven Reinforcement Learning},
author = {Matthew Barthet and Ahmed Khalifa and Antonios Liapis and Georgios N. Yannakakis},
journal= {arXiv preprint arXiv:2208.12622},
year = {2022}
}
备注
8 pages, 5 figures