基于结构 LTL 表示的强化学习零样本指令遵循
机器学习
2026-02-17 v1 人工智能
摘要
我们研究多任务强化学习中的指令遵循问题,即智能体必须在训练期间未见过的新任务上零样本执行。在这种设置下,线性时序逻辑(LTL)最近被采纳作为指定结构化、时延扩展任务的强大框架。虽然现有方法成功地训练了通用策略,但往往难以有效捕捉 LTL 规范中固有的丰富逻辑和时序结构。在本工作中,我们通过学习结构化任务表示来促进训练和泛化,以解决这些问题。我们的方法将策略条件化于由任务有限自动机构建的布尔公式序列。我们提出了层次神经网络来编码这些公式的逻辑结构,并引入注意力机制,使策略能够推理关于未来子目标。在多种复杂环境中的实验表明,我们的方法展现出强大的泛化能力和优异性能。
引用
@article{arxiv.2602.14344,
title = {Zero-Shot Instruction Following in RL via Structured LTL Representations},
author = {Mathias Jackermeier and Mattia Giuri and Jacques Cloete and Alessandro Abate},
journal= {arXiv preprint arXiv:2602.14344},
year = {2026}
}