中文

在决策关键处测试:面向深度强化学习的重要性驱动测试

机器学习 2024-11-13 v1

摘要

在许多深度强化学习(RL)问题中,训练好的策略中的决策对策略的预期安全性和性能的重要性各不相同。由于 RL 策略非常复杂,测试工作应集中在智能体决策对预期结果影响最大的状态上。本文提出了一种新颖的基于模型的方法,严格计算整个状态空间中状态重要性的排序。然后将测试工作集中在排名最高的状态上。本文侧重于安全性测试,但所提出的方法也可轻松扩展到性能测试。在每次迭代中,我们的测试框架计算乐观和悲观的安全性估计。这些估计为策略在状态空间中所有建模状态下的执行预期结果提供了下界和上界。我们的方法在收敛时将状态空间划分为安全和不安全区域,清晰地揭示了策略的弱点。我们的方法具有两个重要特性。(1) 最优测试用例选择:在测试过程的任何时刻,我们的方法都在对安全性最关键的状态下评估策略。(2) 保证安全性:我们的方法仅通过采样策略的一小部分,就能为整个状态空间提供形式化验证保证。由悲观估计所确保的任何安全性质都被形式化证明对该策略成立。我们在多个示例上详细评估了该框架,结果表明我们的方法能以低测试开销发现不安全的策略行为。

关键词

引用

@article{arxiv.2411.07700,
  title  = {Test Where Decisions Matter: Importance-driven Testing for Deep Reinforcement Learning},
  author = {Stefan Pranger and Hana Chockler and Martin Tappler and Bettina Könighofer},
  journal= {arXiv preprint arXiv:2411.07700},
  year   = {2024}
}