Split Q Learning:带双流奖励的强化学习
机器学习
2019-11-14 v2 人工智能
多智能体系统
神经元与认知
机器学习
摘要
受人类决策行为研究的启发,我们在此提出一个强化学习问题的通用参数化框架,其将标准 Q-learning 方法扩展以纳入与多种神经及精神疾病(包括帕金森病、阿尔茨海默病、注意缺陷/多动障碍(ADHD)、成瘾与慢性疼痛)生物学相关的双流奖励处理偏置。对 AI 界而言,开发对不同类型的奖励反应不同的智能体,能使我们理解复杂现实社会经济系统中广泛的多智能体交互。此外,从行为建模视角,我们的参数化框架可视为迈向统一计算模型以捕捉多种精神状况中奖励处理异常及长期推荐系统中用户偏好的第一步。
引用
@article{arxiv.1906.12350,
title = {Split Q Learning: Reinforcement Learning with Two-Stream Rewards},
author = {Baihan Lin and Djallel Bouneffouf and Guillermo Cecchi},
journal= {arXiv preprint arXiv:1906.12350},
year = {2019}
}
备注
IJCAI 2019. This article supersedes our work arXiv:1706.02897 into RL setting, with a different focus by applying Inverse Reinforcement Learning to model human clinical behavioral bias. It also precedes our work arXiv:1906.11286 which introduces extensive emphases in RL games