中文

用于不确定参数环境的可证书鲁棒策略

机器学习 2025-03-25 v5 人工智能 系统与控制 系统与控制

摘要

我们提出了一种数据驱动的方法,用于生成跨不确定随机环境的可证鲁棒策略。现有方法可以学习单个环境的模型作为区间马尔可夫决策过程 (IMDP),并产生具有可能近似正确 (PAC) 保证的鲁棒策略。然而,这些方法无法推理环境参数导致的不确定性的影响。我们提出一种基于参数马尔可夫决策过程 (MDP) 的框架,其中对参数的分布保持未知。我们学习和分析由参数引起的多个未知样本环境的 IMDP。关键挑战在于产生能够结合两种层次不确定性的有意义性能保证:(1) 由参数引起的多个环境,其分布未知;(2) 由 IMDP 近似表示的未知引起的环境。我们提出一种基于情景优化的新方法,产生单个 PAC 保证,量化在特定性能水平可确保的未知环境中的风险水平,同时提供一种在风险与性能之间进行权衡的机制。我们在多个基准上实现和评估了该框架,使用多种鲁棒策略生成方法。我们展示,该方法在高置信度下对策略性能产生紧密的界限。

关键词

引用

@article{arxiv.2408.03093,
  title  = {Certifiably Robust Policies for Uncertain Parametric Environments},
  author = {Yannik Schnitzer and Alessandro Abate and David Parker},
  journal= {arXiv preprint arXiv:2408.03093},
  year   = {2025}
}