中文

通过任务时序逻辑与深度强化学习实现系统性泛化

机器学习 2021-09-14 v3 人工智能 机器学习

摘要

本工作引入一种神经-符号智能体,将深度强化学习(DRL)与时序逻辑(TL)相结合,以实现对形式化指定指令的系统性零样本(即前所未见)泛化。具体而言,我们提出一个神经-符号框架,其中符号模块将 TL 规范转换为有助于训练面向泛化的 DRL 智能体的形式,而神经模块系统地学习解决给定任务。我们在不同设定下研究了系统性学习的涌现,发现卷积层架构在泛化到新指令时至关重要。我们还提供证据表明,当从少量训练样本学习时,系统性学习可借助否定等抽象算子涌现,而这是先前研究难以处理的。

关键词

引用

@article{arxiv.2006.08767,
  title  = {Systematic Generalisation through Task Temporal Logic and Deep Reinforcement Learning},
  author = {Borja G. León and Murray Shanahan and Francesco Belardinelli},
  journal= {arXiv preprint arXiv:2006.08767},
  year   = {2021}
}