利用强化学习适应性地进行 MCMC
统计计算
2025-07-02 v1 机器学习
机器学习
摘要
采样算法是概率机器学习的驱动力,近年来出现了工具的多样性激增。然而,采样算法日益复杂的趋势与调参负担的增加不成比例。如今,越来越需要将采样器的调参视为独立的学习任务。概念性突破在于王等人(2025)将Metropolis-Hastings 建模为马尔可夫决策过程,开辟了使用强化学习(RL)进行自适应调参的可能性。他们的工作侧重于理论基础;实现强化学习Metropolis-Hastings(\textit{RLMH})的实际效益留给后续工作。本文目的有二:其一,我们观察到诸如接受率或预期平方跳动距离等自然奖励选择,对训练\textit{RLMH}提供的信号不足。相反,我们提出一种基于对比散度的新型奖励,其在\textit{RLMH}语境中的优势通过实验得以证明。其二,我们探索\textit{RLMH}的潜力,并呈现一种自适应梯度采样器,该采样器在马尔可夫转移核的灵活性与关联RL任务的可学习性之间进行平衡。基于\textit{postiordb}基准的全面仿真研究支持了\textit{RLMH}的实际有效性。
引用
@article{arxiv.2507.00671,
title = {Harnessing the Power of Reinforcement Learning for Adaptive MCMC},
author = {Congye Wang and Matthew A. Fisher and Heishiro Kanagawa and Wilson Chen and Chris. J. Oates},
journal= {arXiv preprint arXiv:2507.00671},
year = {2025}
}