POMDP中加速在线风险敏感策略评估:理论保证与新型CVaR界限
统计理论
2026-02-27 v1 人工智能
统计理论
摘要
在不确定性下进行风险导向决策是人工智能中的核心挑战,是开发可靠自主代理的必备条件。该问题的正式框架是部分可观测马尔可夫决策过程(POMDP),其中通过应用于价值函数的风险度量引入风险敏感性,其中条件价值-at-Risk(CVaR)是特别重要的准则。然而,求解POMDP在一般情况下是计算不可行的,近似方法依赖于对未来代理轨迹的计算昂贵模拟。本工作引入了一个用于在POMDP中对CVaR价值函数评估进行加速的理论框架,提供正式的性能保证。我们推导了使用辅助随机变量Y来估计随机变量X的CVaR的新界限,在关于其累积分布函数和密度函数之间关系的假设下,这些界限导致可解释的浓度不等式,并在分布差异消失时收敛。基于此,我们在容纳一般转换动力学简化的简化信念-MDP上建立了CVaR价值函数的上界和下界。我们开发了这些界限的估计器,置于基于粒子信念的MDP框架中,并具备概率保证,用于通过动作消除进行加速:在简化模型下,那些表明其在简化模型下次优的动作被安全地丢弃,以确保与原始POMDP一致。跨多个POMDP领域的实证评估表明,这些界限可靠地区分了安全与危险的政策,同时在简化模型下实现了显著的计算加速。
引用
@article{arxiv.2602.23073,
title = {Accelerated Online Risk-Averse Policy Evaluation in POMDPs with Theoretical Guarantees and Novel CVaR Bounds},
author = {Yaacov Pariente and Vadim Indelman},
journal= {arXiv preprint arXiv:2602.23073},
year = {2026}
}