受超属性约束的安全强化学习
人工智能
2025-08-04 v1 机器学习
计算机科学中的逻辑
系统与控制
系统与控制
摘要
时窗时序逻辑(HyperTWTL)的超属性是一种已知在机器人应用中高效紧凑地表示安全性、隐私和并发性的领域特定形式规范语言。本文聚焦于受HyperTWTL约束的安全强化学习(SecRL)。尽管时序逻辑约束的安全强化学习(SRL)是正在发展中的研究问题,已有多个文献,但在探索基于超属性的安全感知强化学习(RL)方面存在显著研究空白。给定代理的动力学作为马尔可夫决策过程(MDP)且将隐私/安全约束形式化为HyperTWTL,我们提出了一种方法,通过动态玻尔兹爵士软最大熵RL学习以满足HyperTWTL约束,学习出安全感知的最优策略。我们在一次拣取递送机器人任务案例研究中展示了所提出方法的有效性和可扩展性。我们还与两种其他基线RL算法进行了比较,结果表明所提方法优于它们。
引用
@article{arxiv.2508.00106,
title = {Hyperproperty-Constrained Secure Reinforcement Learning},
author = {Ernest Bonnah and Luan Viet Nguyen and Khaza Anuarul Hoque},
journal= {arXiv preprint arXiv:2508.00106},
year = {2025}
}
备注
Accepted in IEEE/ACM MEMOCODE 2025