面向安全约束反应式综合的规范学习
机器人学
2026-01-12 v1 形式语言与自动机理论
摘要
本文提出了一种新颖的示教学习方法,使机器人能够在动态环境中自主执行复杂任务。我们将潜在任务建模为概率形式语言,并引入一个定制的反应式综合框架,以平衡机器人成本与用户任务偏好。我们的方法侧重于安全约束学习,并将形式化任务规范推断为概率确定性有限自动机(PDFA)。我们改进了现有的证据驱动状态合并算法,并在整个学习过程中融入安全要求,以确保学习到的PDFA始终符合安全约束。此外,我们引入了一种多目标反应式综合算法,该算法生成确定性策略,保证在满足PDFA任务的同时,优化用户偏好与机器人成本之间的权衡,从而产生帕累托最优解前沿。我们将交互建模为机器人与环境之间的双人博弈,并考虑了动态变化。我们提出了一种计算上易于处理的值迭代算法,以生成帕累托前沿及相应的确定性策略。全面的实验结果表明,我们的算法在各种机器人和任务中均有效,证明了学习到的PDFA从不包含不安全行为,并且综合出的策略能持续完成任务,同时满足机器人成本和用户偏好的要求。
引用
@article{arxiv.2601.05533,
title = {Learning specifications for reactive synthesis with safety constraints},
author = {Kandai Watanabe and Nicholas Renninger and Sriram Sankaranarayanan and Morteza Lahijanian},
journal= {arXiv preprint arXiv:2601.05533},
year = {2026}
}