R-ParVI:基于奖励的粒子变分推断
人工智能
2025-03-03 v1
摘要
提出一种基于奖励的、无梯度的ParVI方法,称为 \textit{R-ParVI},用于从部分已知密度(例如已知归一化常数)中进行抽样。R-ParVI 将抽样问题形式化为由奖励驱动的粒子流:粒子从先验分布中抽取,通过由奖励机制决定的运动在参数空间中导航,最终的稳态粒子配置近似目标几何。粒子与环境之间的相互作用通过随机扰动和奖励机制模拟,后者驱动粒子向高密度区域移动,同时保持多样性(例如防止聚集崩溃)。R-ParVI 提供了快速、灵活、可扩展且具有随机性的抽样与推断方法,适用于贝叶斯推断和生成模型中常见的概率模型类。
引用
@article{arxiv.2502.20482,
title = {R-ParVI: Particle-based variational inference through lens of rewards},
author = {Yongchao Huang},
journal= {arXiv preprint arXiv:2502.20482},
year = {2025}
}