具有条件效应的 PDDL 域安全学习——扩展版
人工智能
2024-03-25 v1
摘要
强大的领域无关规划器已被开发用于解决各类规划问题。这些规划器通常需要以某种规划领域描述语言给出的行动主体动作模型。手动设计这样的动作模型是一项公认极具挑战性的任务。另一种选择是从观察中自动学习动作模型。如果一个动作模型生成的每个规划都与真实的、未知的动作模型一致,则称该模型是安全的。学习此类安全动作模型的算法已经存在,但它们无法处理具有条件效应或全称效应的领域,而这些是许多规划问题中的常见结构。我们证明了学习具有条件效应的非平凡安全动作模型可能需要指数级数量的样本。然后,我们确定了使此类学习变得可处理的合理假设,并提出了条件效应安全动作模型学习算法(Conditional-SAM),这是首个能够做到这一点的算法。我们从理论上分析了 Conditional-SAM,并通过实验对其进行了评估。我们的结果表明,在大多数实验领域中,Conditional-SAM 学习到的动作模型能够完美解决大部分测试集问题。
引用
@article{arxiv.2403.15251,
title = {Safe Learning of PDDL Domains with Conditional Effects -- Extended Version},
author = {Argaman Mordoch and Enrico Scala and Roni Stern and Brendan Juba},
journal= {arXiv preprint arXiv:2403.15251},
year = {2024}
}