从无监督视觉轨迹中学习提升动作模型
人工智能
2026-05-08 v2
摘要
高效构建捕获动作 preconditions 和 effects 的模型对于将 AI 规划应用于现实世界领域至关重要。广泛的前期工作探索了从状态和/或动作序列的高层描述中学习此类模型。本文针对更具挑战性的设置:从状态图像序列中学习提升动作模型(无需观察动作),提出了一种深度学习框架,联合学习状态预测、动作预测以及提升动作模型。我们还引入一种混合整数线性规划(MILP),以防止预测崩溃和自强化错误。在 MILP 中,我们对预测的状态、动作和动作模型在一部分轨迹上的预测结果进行求解,以寻找与原始预测尽可能接近的逻辑一致的状态、动作和动作模型。随后,从 MILP 解决方案中提取的伪标签用于指导进一步的训练。跨多个领域的实验表明,集成 MILP 基于纠正的模型有助于模型摆脱局部最优,趋向全局一致的解决方案。
引用
@article{arxiv.2604.19043,
title = {Learning Lifted Action Models from Unsupervised Visual Traces},
author = {Kai Xi and Stephen Gould and Sylvie Thiébaux},
journal= {arXiv preprint arXiv:2604.19043},
year = {2026}
}
备注
Accepted to the 36th International Conference on Automated Planning and Scheduling (ICAPS-26)