跟随星火计划:动态 $\omega$-正则屏蔽已学习策略
人工智能
2025-10-23 v3 计算机科学中的逻辑
摘要
本文提出一种新颖的动态后置屏蔽框架,用于强制执行预计算概率策略上的完整 -正则正确性属性。这标志着从主要的安全屏蔽范式——即确保不会发生坏事——转向一个额外强制保证 liveness 的屏蔽过程,即确保某件好事最终会发生。核心方法是使用基于策略模板的自适应运行时屏蔽 (STARs),这些方法利用 Permissive 策略模板以实现最小干扰的后置屏蔽。其主要特点是 STARs 引入一种动态控制干扰的机制,允许可调的强制执行参数在形式义务和任务特定行为之间进行权衡。这使得可以在需要时触发更激进的强制执行,而在其他情况下则允许优化的策略选择。此外,STARs 支持对更改的规范或执行器故障进行运行时适应,特别适用于网络-物理系统。在我们对移动机器人基准测试中评估了 STARs,以展示其在执行(逐步更新)-正则正确性属性时对干扰的可控性。
关键词
引用
@article{arxiv.2505.14689,
title = {Follow the STARs: Dynamic $\omega$-Regular Shielding of Learned Policies},
author = {Ashwani Anand and Satya Prakash Nayak and Ritam Raha and Anne-Kathrin Schmuck},
journal= {arXiv preprint arXiv:2505.14689},
year = {2025}
}