简而言之,人类要求如此:遵循时序规范的潜在目标
人工智能
2022-02-25 v2 机器学习
摘要
我们致力于解决构建智能体的问题,这些智能体的目标是通过深度强化学习(DRL),学习执行以时序逻辑(TL)表达的分布外(OOD)多任务指令。最近的工作提供了证据,表明当 DRL 智能体学习求解 TL 中的 OOD 任务时,智能体的神经架构是一个关键特征。然而,关于这一主题的研究仍处于起步阶段。在本工作中,我们提出了一种新的深度学习配置,其归纳偏差引导智能体生成其当前目标的潜在表示,从而产生更强的泛化性能。我们在一个执行多任务形式化定义指令的神经符号框架内使用这些潜在目标网络,并将所提出的神经网络与在 OOD 环境中泛化到未见指令时采用不同的最先进(SOTA)架构的性能进行了对比。
引用
@article{arxiv.2110.09461,
title = {In a Nutshell, the Human Asked for This: Latent Goals for Following Temporal Specifications},
author = {Borja G. León and Murray Shanahan and Francesco Belardinelli},
journal= {arXiv preprint arXiv:2110.09461},
year = {2022}
}