随机环境中的绕行问题:重温 Tolman
机器学习
2017-09-29 v1 神经元与认知
摘要
我们设计了一个网格世界任务,以研究人类在未知随机环境中的规划与重规划行为。在我们的网格世界中,参与者被要求从随机起点前往随机目标位置,同时最大化其奖励。由于他们不熟悉环境,需要从经验中学习其特征以进行最优规划。在任务的后期,我们随机封锁了最优路径,以调查人们是否以及如何调整其原始计划以找到绕行路径。为此,我们开发并比较了 12 个不同的模型。这些模型在如何学习和表示环境以及如何规划以达成目标方面有所不同。我们的大多数参与者能够进行最优规划。我们还表明,当意外事件发生时,人们能够修改他们的计划。模型比较的结果表明,基于模型的强化学习方法对数据提供了最佳解释,并且在解释重规划试验中的行为数据方面优于启发式方法。
引用
@article{arxiv.1709.09761,
title = {The detour problem in a stochastic environment: Tolman revisited},
author = {Pegah Fakhari and Arash Khodadadi and Jerome Busemeyer},
journal= {arXiv preprint arXiv:1709.09761},
year = {2017}
}
备注
44 pages, 7 figures, 5 tables