中文

基于经验似然的情境 bandit 政策贝叶斯推断

机器学习 2026-02-12 v1 机器学习

摘要

政策推断是情境 bandit 问题中的关键环节。本文采用经验似然方法,构建一种用于有限样本情境下多政策联合推断的贝叶斯推断方法。该推断方法对小样本量鲁棒,能够为政策价值评估提供精确的不确定性度量。此外,它支持在完整不确定性量化下进行灵活的政策比较。我们通过蒙特卡罗模拟并以青少年体质指数数据集为例,展示了所提推断方法的有效性。

关键词

引用

@article{arxiv.2602.10608,
  title  = {Bayesian Inference of Contextual Bandit Policies via Empirical Likelihood},
  author = {Jiangrong Ouyang and Mingming Gong and Howard Bondell},
  journal= {arXiv preprint arXiv:2602.10608},
  year   = {2026}
}

备注

Accepted for publication in JMLR