中文

基于扩散生成先验的汤普森采样

机器学习 2023-01-31 v2 人工智能 机器学习

摘要

在这项工作中,我们开创性地提出使用去噪扩散模型来学习在线决策问题的先验。我们特别关注多臂老虎机框架的元学习,目标是学习一个能在同一类老虎机任务中表现良好的策略。为此,我们训练了一个扩散模型来学习底层任务分布,并将汤普森采样与学习到的先验相结合,以在测试时处理新任务。我们的后验采样算法旨在仔细平衡学习到的先验与来自学习器与环境交互的噪声观测。为了捕捉现实的老虎机场景,我们还提出了一种新颖的扩散模型训练过程,该过程甚至可以从不完整和/或有噪声的数据中进行训练,这可能具有独立的研究价值。最后,我们广泛的实验评估清楚地证明了所提出方法的潜力。

关键词

引用

@article{arxiv.2301.05182,
  title  = {Thompson Sampling with Diffusion Generative Prior},
  author = {Yu-Guan Hsieh and Shiva Prasad Kasiviswanathan and Branislav Kveton and Patrick Blöbaum},
  journal= {arXiv preprint arXiv:2301.05182},
  year   = {2023}
}