面向疟疾控制的数据高效强化学习
机器学习
2021-05-06 v2 人工智能
摘要
在成本敏感任务下的序贯决策令人望而生畏,尤其是对于那些对人们日常生活有重大影响的问题,如疟疾控制、治疗推荐。政策制定者面临的主要挑战是仅通过少量试验与复杂环境交互,从零开始学习策略。本工作提出一种实用的、数据高效的策略学习方法,称为方差奖励蒙特卡洛树搜索(Variance-Bonus Monte Carlo Tree Search, VB-MCTS),它能够应对极少数据并在仅少数试验中实现从零学习。具体而言,该方案是一种基于模型的强化学习方法。为避免模型偏差,我们应用高斯过程(Gaussian Process, GP)回归来显式估计转移。借助 GP 世界模型,我们提出一种方差奖励以度量关于世界的不确定性。将该奖励加入基于 MCTS 的规划中,可实现更高效且更有效的探索。此外,推导出的多项式样本复杂度表明 VB-MCTS 具有样本高效性。最后,在一项具有竞争力的世界级 RL 竞赛上的出色表现以及广泛的实验结果,验证了其在极具挑战性的疟疾控制任务上相对于最先进方法的优势。
引用
@article{arxiv.2105.01620,
title = {Data-Efficient Reinforcement Learning for Malaria Control},
author = {Lixin Zou and Long Xia and Linfang Hou and Xiangyu Zhao and Dawei Yin},
journal= {arXiv preprint arXiv:2105.01620},
year = {2021}
}
备注
7 pages, 4 figures, IJCAI 2021 Accepted Paper