逆理性控制:从觅食方式推断你的想法
机器学习
2019-06-13 v4 机器学习
摘要
复杂行为通常由内部模型驱动,该模型随时间整合感官信息并促进长期规划。推断智能体的内部模型是社会互动(心智理论)、模仿学习以及解释行为智能体神经活动的关键要素。在此,我们描述了一种在不确定环境下对智能体行为进行建模的通用方法,并推断智能体的内部模型、奖励函数和动态信念。我们将该方法应用于执行自然觅食任务的模拟智能体。我们假设智能体表现理性——即它们根据对任务及相关因果变量的理解,采取优化其主观效用的行动。我们将此理解解建模为部分可观测马尔可夫决策过程(POMDP),其中智能体可能对任务参数做出错误假设。给定智能体的感官观测和行动,我们通过对一组任务相关参数进行最大似然估计来学习其内部模型和奖励函数。POMDP 的马尔可夫特性使我们能够表征内部信念状态之间的转移概率,并使用受约束的期望最大化(EM)算法迭代估计智能体的策略。我们在目前许多神经科学实验使用的觅食任务中表现次优的模拟智能体上验证了我们的方法,并成功恢复了它们的内部模型和奖励函数。我们的工作为发现大脑如何表示和利用动态信念进行计算奠定了关键基础。
引用
@article{arxiv.1805.09864,
title = {Inverse Rational Control: Inferring What You Think from How You Forage},
author = {Zhengwei Wu and Paul Schrater and Xaq Pitkow},
journal= {arXiv preprint arXiv:1805.09864},
year = {2019}
}