中文

基于近似贝叶斯计算的概率离线策略排序

机器学习 2023-12-20 v1 人工智能

摘要

在实践中,为了安全性和可靠性,在现实世界部署之前离线比较和排序候选策略至关重要。先前的工作试图通过基于价值的方法(如离线策略评估 OPE)来解决离线策略排序(OPR)问题。然而,由于缺乏对策略性能的整体表征,它们无法分析特殊情况下的性能(例如最坏或最佳情况)。在奖励在稀疏设置下不完全可访问时,估计精确的策略值甚至更加困难。在本文中,我们提出了概率离线策略排序(POPR),这是一个利用专家数据来表征候选策略表现得像专家的概率,并近似其整个性能后验分布以辅助排序的框架,旨在解决 OPR 问题。POPR 不依赖于价值估计,导出的性能后验可用于区分候选策略在最坏、最佳和平均情况下的表现。为了估计后验,我们提出了 POPR-EABC,一种进行无似然推断的基于能量的近似贝叶斯计算(ABC)方法。POPR-EABC 通过平滑能量函数减少了 ABC 的启发式性质,并通过伪似然提高了采样效率。实证表明,POPR-EABC 足以在各种实验环境中评估离散和连续动作空间中的策略,并促进了部署前候选策略的概率比较。

关键词

引用

@article{arxiv.2312.11551,
  title  = {Probabilistic Offline Policy Ranking with Approximate Bayesian Computation},
  author = {Longchao Da and Porter Jenkins and Trevor Schwantes and Jeffrey Dotson and Hua Wei},
  journal= {arXiv preprint arXiv:2312.11551},
  year   = {2023}
}

备注

19 pages with 7 pages main paper, 10 pages appendix. Accepted to AAAI 2024 main track