超越胜负:基于逆强化学习的人类动机与行为建模
机器学习
2018-07-06 v2 人工智能
机器学习
摘要
近年来,强化学习(RL)方法已成功应用于游戏建模,在 Atari、Go 和 Poker 等多种环境中达到了超人类表现。然而,这些研究大多聚焦于赢得游戏,并在很大程度上忽略了丰富而复杂的人类动机,而后者对于理解不同玩家的多样化行为至关重要。本文提出一种称为多动机行为建模(MMBM)的新方法,该方法考虑多面的人类动机,并利用逆 RL 对玩家的潜在价值结构进行建模。我们的方法不需要访问系统动态,从而能够对诸如大型多人在线游戏等复杂交互环境进行建模。MMBM 在《魔兽世界》角色历史数据集上进行了测试,该数据集记录了超过 70,000 名用户跨越三年的游戏过程。我们的模型揭示了不同玩家群体间价值结构的显著差异。利用动机建模结果,我们还预测并解释了他们多样化的游戏行为,并定量评估了游戏环境重新设计对玩家行为的影响。
引用
@article{arxiv.1807.00366,
title = {Beyond Winning and Losing: Modeling Human Motivations and Behaviors Using Inverse Reinforcement Learning},
author = {Baoxiang Wang and Tongfang Sun and Xianjun Sam Zheng},
journal= {arXiv preprint arXiv:1807.00366},
year = {2018}
}