PAC-Bayesian 奖励认证加权学习
机器学习
2026-04-03 v1 统计方法学
机器学习
摘要
通过结果加权学习(OWL)估计最优个体化治疗规则(ITRs)时,常依赖用于真实潜在效用的噪声或乐观代理的观察奖励。忽略这种奖励不确定性会导致所选策略表现被高估,而现有的OWL框架缺乏对随机IITs保证的有限样本保证,以系统性地将此类不确定性纳入学习目标。为此,我们提出PAC-Bayesian Reward-Certified Outcome Weighted Learning(PROWL)。给定一个单侧不确定性证书,PROWL构建保守的奖励和严格依赖于策略的下界。理论上,我们证明了将鲁棒政策学习 exact 化为统一、无分裂的成本敏感分类任务的精确认证化简。这种表述使我们能够推导出针对随机ITRs的非渐近PAC-Bayes下界,其中我们建立了最大化该下界的最优后验正好由一般贝叶斯更新完全特征化。为克服广义贝叶斯推断中固有的学习率选择问题,我们引入一种完全自动化、基于界限的校准程序,搭配Fisher一致的认证 hinge surrogate 以实现高效优化。我们的实验表明,在严重奖励不确定性下,PROWL在估计稳健、高价值治疗方案时优于标准方法。
引用
@article{arxiv.2604.01946,
title = {PAC-Bayesian Reward-Certified Outcome Weighted Learning},
author = {Yuya Ishikawa and Shu Tamano},
journal= {arXiv preprint arXiv:2604.01946},
year = {2026}
}