一种用于人机辅助决策的联合规划与学习框架
人工智能
2019-12-25 v3
摘要
传统强化学习(RL)仅允许智能体通过环境奖励学习策略,学习曲线长且缓慢,尤其在初始阶段。相反,人类学习通常快得多,因为利用了先验与通用知识以及多种信息资源。在本文中,我们提出一种以人为中心的规划与学习的规划者-行动者-评论者架构(PACMAN),其中智能体利用先验的、高层的、确定性的符号知识来规划目标导向动作。PACMAN 集成了 RL 的行动者-评论者算法,以针对环境奖励与人类反馈微调其行为。据我们所知,这是首个知识型规划、RL 与人类教导共同贡献于智能体策略学习的统一框架。我们的实验表明,PACMAN 在学习早期带来显著的起步跃升,收敛迅速且方差小,并对不一致、不频繁及误导性反馈具有鲁棒性。
引用
@article{arxiv.1906.07268,
title = {A Joint Planning and Learning Framework for Human-Aided Decision-Making},
author = {Daoming Lyu and Fangkai Yang and Bo Liu and Steven Gustafson},
journal= {arXiv preprint arXiv:1906.07268},
year = {2019}
}