一次一个子目标:多任务强化学习中对任意线性时序逻辑需求的零样本泛化
人工智能
2025-11-11 v6
摘要
泛化到复杂且时间延展的任务目标与安全约束,仍然是强化学习中的一个关键挑战。线性时序逻辑为指定此类需求提供了统一的形式化体系,然而现有方法在处理嵌套的长时域任务和安全约束方面能力有限,并且无法识别子目标不可满足而应寻求替代方案的情况。在本文中,我们介绍了 GenZ-LTL,一种能够对任意 LTL 规范实现零样本泛化的方法。GenZ-LTL 利用 Büchi 自动机的结构,将 LTL 任务规范分解为一系列可达-避障子目标。与当前最先进的、以子目标序列为条件的方法相反,我们表明,通过适当的安全 RL 公式化,一次解决一个子目标这些可达-避障问题,对于实现零样本泛化更为有效。此外,我们引入了一种新颖的子目标诱导观测约简技术,该技术可以在现实假设下缓解子目标-状态组合的指数级复杂度。实验结果表明,GenZ-LTL 在对未见过的 LTL 规范进行零样本泛化方面,显著优于现有方法。
引用
@article{arxiv.2508.01561,
title = {One Subgoal at a Time: Zero-Shot Generalization to Arbitrary Linear Temporal Logic Requirements in Multi-Task Reinforcement Learning},
author = {Zijian Guo and İlker Işık and H. M. Sabbir Ahmad and Wenchao Li},
journal= {arXiv preprint arXiv:2508.01561},
year = {2025}
}