多臂老虎机、上下文老虎机与强化学习中人类行为主体的统一模型
人工智能
2021-12-28 v5 机器学习
神经元与认知
机器学习
摘要
人工行为主体通常根据其一致的行为以及在环境中采取序贯动作以最大化某种累积奖励概念上的表现来进行评估。然而,现实生活中的人类决策通常涉及不同的策略和导致相同经验结果的行为轨迹。受广泛神经与精神疾病的临床文献启发,我们在此提出一个更通用且灵活的序贯决策参数化框架,其涉及双流奖励处理机制。我们证明了该框架足够灵活和统一,可纳入涵盖多臂老虎机 (MAB)、上下文老虎机 (CB) 和强化学习 (RL) 的一系列问题,这些问题在不同层次上分解了序贯决策过程。受许多精神障碍已知奖励处理异常的启发,我们受临床启发的主体在模拟任务、捕捉赌博任务中人类决策的实时数据集以及 PacMan 游戏中,跨不同奖励平稳性的终身学习任务上,展现出有趣的行为轨迹与可比的表现。
引用
@article{arxiv.2005.04544,
title = {Unified Models of Human Behavioral Agents in Bandits, Contextual Bandits and RL},
author = {Baihan Lin and Guillermo Cecchi and Djallel Bouneffouf and Jenna Reinen and Irina Rish},
journal= {arXiv preprint arXiv:2005.04544},
year = {2021}
}
备注
Proceeding of HBAI 2020. This article supersedes and extends our work arXiv:1706.02897 (MAB) and arXiv:1906.11286 (RL) into the Contextual Bandit (CB) framework. It generalized extensively into multi-armed bandits, contextual bandits and RL settings to create a unified framework of human behavioral agents