强化学习中子目标自动机的归纳与利用
人工智能
2021-03-18 v2 机器学习
摘要
本文提出 ISA,一种在情节式强化学习(RL)任务中学习并利用子目标的方法。ISA 将强化学习与子目标自动机的归纳交错进行,该自动机的边由以一组高层事件上的命题逻辑公式表示的任务子目标所标记。子目标自动机还包含两个特殊状态:一个表示任务成功完成的状态,以及一个表示任务未成功而结束的状态。利用最先进的归纳逻辑编程系统来学习一个覆盖 RL 智能体观测到的高层事件轨迹的子目标自动机。当当前所利用的自动机不能正确识别某条轨迹时,自动机学习器归纳出一个覆盖该轨迹的新自动机。该交错过程保证了具有最少状态数的自动机的归纳,并应用对称破缺机制在保持完备性的同时缩小搜索空间。我们使用不同的利用自动机结构的 RL 算法,在若干网格世界和连续状态空间问题中对 ISA 进行评估。我们针对轨迹、对称破缺以及对最终可学习自动机施加的特定限制,提供了自动机学习性能的深入实证分析。对于每类 RL 问题,我们表明所学自动机能成功被用于学习达到目标策略,取得的平均奖励与未学习自动机而事先手工给定自动机的情况相当。
引用
@article{arxiv.2009.03855,
title = {Induction and Exploitation of Subgoal Automata for Reinforcement Learning},
author = {Daniel Furelos-Blanco and Mark Law and Anders Jonsson and Krysia Broda and Alessandra Russo},
journal= {arXiv preprint arXiv:2009.03855},
year = {2021}
}
备注
Published in the Journal of Artificial Intelligence Research (JAIR)