中文

一种用于贝叶斯马尔可夫决策过程的离线风险感知策略选择方法

机器学习 2026-05-26 v2 人工智能 系统与控制 系统与控制

摘要

在用于规划的离线模型学习和离线强化学习中,有限的数据集阻碍了对相应马尔可夫决策过程(MDP)价值函数的估计。因此,所得策略在真实世界中的性能受限且可能存在风险,尤其在部署错误策略可能导致灾难性后果时。为此,人们正从多条途径着手,以减小模型误差(或所学模型与真实模型之间的分布偏移),更广泛地说,以获得针对模型不确定性的风险感知解。但当最终应用时,实践者应选择哪个基线?在计算时间不成问题且鲁棒性为优先级的离线背景下,我们提出 Exploitation vs Caution(EvC,利用与谨慎)范式,它(1)遵循贝叶斯形式优雅地纳入模型不确定性,(2)在贝叶斯后验上,从给定的一组候选策略(例如由当前基线提供)中选择最大化风险感知目标的策略。我们在不同的离散但简单的环境中,以涵盖相当多样 MDP 类别的方式,用最先进的方法验证了 EvC。在测试场景中,EvC 能够选择鲁棒策略,因此作为旨在将离线规划和强化学习求解器应用于真实世界的实践者的有用工具而脱颖而出。

关键词

引用

@article{arxiv.2105.13431,
  title  = {An Offline Risk-aware Policy Selection Method for Bayesian Markov Decision Processes},
  author = {Giorgio Angelotti and Nicolas Drougard and Caroline Ponzoni Carvalho Chanel},
  journal= {arXiv preprint arXiv:2105.13431},
  year   = {2026}
}

备注

Preprint, under review