中文

跟随星火计划:动态 $\omega$-正则屏蔽已学习策略

人工智能 2025-10-23 v3 计算机科学中的逻辑

摘要

本文提出一种新颖的动态后置屏蔽框架,用于强制执行预计算概率策略上的完整 ω\omega-正则正确性属性。这标志着从主要的安全屏蔽范式——即确保不会发生坏事——转向一个额外强制保证 liveness 的屏蔽过程,即确保某件好事最终会发生。核心方法是使用基于策略模板的自适应运行时屏蔽 (STARs),这些方法利用 Permissive 策略模板以实现最小干扰的后置屏蔽。其主要特点是 STARs 引入一种动态控制干扰的机制,允许可调的强制执行参数在形式义务和任务特定行为之间进行权衡。这使得可以在需要时触发更激进的强制执行,而在其他情况下则允许优化的策略选择。此外,STARs 支持对更改的规范或执行器故障进行运行时适应,特别适用于网络-物理系统。在我们对移动机器人基准测试中评估了 STARs,以展示其在执行(逐步更新)ω\omega-正则正确性属性时对干扰的可控性。

关键词

引用

@article{arxiv.2505.14689,
  title  = {Follow the STARs: Dynamic $\omega$-Regular Shielding of Learned Policies},
  author = {Ashwani Anand and Satya Prakash Nayak and Ritam Raha and Anne-Kathrin Schmuck},
  journal= {arXiv preprint arXiv:2505.14689},
  year   = {2025}
}