通过任务时序逻辑与深度强化学习实现系统性泛化
机器学习
2021-09-14 v3 人工智能
机器学习
摘要
本工作引入一种神经-符号智能体,将深度强化学习(DRL)与时序逻辑(TL)相结合,以实现对形式化指定指令的系统性零样本(即前所未见)泛化。具体而言,我们提出一个神经-符号框架,其中符号模块将 TL 规范转换为有助于训练面向泛化的 DRL 智能体的形式,而神经模块系统地学习解决给定任务。我们在不同设定下研究了系统性学习的涌现,发现卷积层架构在泛化到新指令时至关重要。我们还提供证据表明,当从少量训练样本学习时,系统性学习可借助否定等抽象算子涌现,而这是先前研究难以处理的。
引用
@article{arxiv.2006.08767,
title = {Systematic Generalisation through Task Temporal Logic and Deep Reinforcement Learning},
author = {Borja G. León and Murray Shanahan and Francesco Belardinelli},
journal= {arXiv preprint arXiv:2006.08767},
year = {2021}
}