中文

动态治疗机制中悲观主义的优化:一种贝叶斯学习方法

机器学习 2023-02-23 v2 机器学习

摘要

在本文中,我们提出了一种新颖的基于悲观主义的贝叶斯学习方法,用于离线环境下的最优动态治疗机制。当覆盖条件不成立时(这对于离线数据很常见),现有解决方案会产生次优策略。悲观主义原则通过不鼓励在给定状态下推荐探索较少的动作来解决此问题。然而,几乎所有基于悲观主义的方法都依赖于一个关键超参数来量化悲观程度,并且方法的性能对该参数的选择可能高度敏感。我们提出将悲观主义原则与Thompson采样和贝叶斯机器学习相结合,以优化悲观程度。我们推导出一个可信集,其边界一致地下界最优Q函数,因此我们不需要对悲观程度进行额外调整。我们开发了一种通用的贝叶斯学习方法,适用于一系列模型,从贝叶斯线性基模型到贝叶斯神经网络模型。我们基于变分推断开发了计算算法,该方法高效且可扩展。我们建立了所提方法的理论保证,并通过仿真和真实数据示例经验性地表明它优于现有的最先进解决方案。

关键词

引用

@article{arxiv.2210.14420,
  title  = {Optimizing Pessimism in Dynamic Treatment Regimes: A Bayesian Learning Approach},
  author = {Yunzhe Zhou and Zhengling Qi and Chengchun Shi and Lexin Li},
  journal= {arXiv preprint arXiv:2210.14420},
  year   = {2023}
}

备注

18 pages, 6 figures. Proceedings of the 26th International Conference on Artificial Intelligence and Statistics (AISTATS) 2023