平均风险感知 MDP 中的规划与学习
机器学习
2025-12-23 v3 最优化与控制
摘要
对于持续性任务,平均代价马尔可夫决策过程具有成熟的价值函数,且可由高效算法求解。然而,其明确假设智能体是风险中性的。在本文中,我们将风险中性算法推广至更一般的动态风险测度类别。具体而言,我们提出了一种用于规划的相对值迭代(RVI)算法,并设计了两种无模型 Q 学习算法:一种基于多层蒙特卡洛(MLMC)方法的通用算法,以及一种专用于基于效用函数的 shortfall 风险测度的离策略算法。RVI 算法与基于 MLMC 的 Q 学习算法均被证明收敛至最优。数值实验验证了我们的分析,经验性地确认了离策略算法的收敛性,并表明我们的方法能够识别出针对其所服务智能体的复杂风险感知进行精细调优的策略。
引用
@article{arxiv.2503.17629,
title = {Planning and Learning in Average Risk-aware MDPs},
author = {Weikai Wang and Erick Delage},
journal= {arXiv preprint arXiv:2503.17629},
year = {2025}
}