中文

利用逆强化学习对现实世界人类风险决策进行建模与解释

机器学习 2019-06-14 v1 神经元与认知 机器学习

摘要

为了理解人类在风险下的真实决策,我们利用逆强化学习(IRL)对风险任务中的人类决策行为进行了建模。据我们所知,这是首个应用 IRL 揭示人类风险决策中隐含奖励函数,并解释风险偏好与风险规避决策策略的工作。我们假设状态历史(例如先前试验中的奖励与决策)与人类奖励函数相关,进而导致了风险规避与风险偏好决策。我们在 IRL 的奖励函数中设计了反映这些因素的特征,并学习相应的可解释为特征重要性的权重。结果证实了由个性化奖励函数驱动的人类风险相关决策的次优性。具体而言,风险偏好者倾向于基于当前的充气数做出决策,而风险规避者则依赖先前试验的爆破信息与平均结束状态。我们的结果表明,IRL 是建模人类决策行为以及帮助解释风险决策中人类心理过程的有效工具。

关键词

引用

@article{arxiv.1906.05803,
  title  = {Modeling and Interpreting Real-world Human Risk Decision Making with Inverse Reinforcement Learning},
  author = {Quanying Liu and Haiyan Wu and Anqi Liu},
  journal= {arXiv preprint arXiv:1906.05803},
  year   = {2019}
}

备注

Real-world Sequential Decision Making Workshop at ICML 2019