基于离策略对数离散正则化的玻尔兹曼生成器高效训练
机器学习
2026-02-04 v1
摘要
从未归一化概率密度进行采样是计算科学中的核心挑战。玻尔兹曼生成器是一种生成模型,使我们能够在给定温度下独立采样自物理系统的玻尔兹曼分布。然而,其实际成功依赖于数据高效训练,因为模拟数据和目标能量评估都昂贵。为此,我们提出了离策略对数离散正则化(LDR),这是一种新型正则化框架,基于对数方差目标的推广。我们在离策略设置下结合标准数据驱动训练目标应用 LDR,而无需额外的 on-policy 样本。LDR 通过利用目标能量标签中的额外信息,作为能量景观的形状正则器。该新型正则化框架具有广泛适用性,支持无偏或偏的模拟数据集,亦可用于不依赖目标样本的纯变分训练。在所有基准测试中,LDR 在最终性能和数据效率方面均取得改进,样本效率提升最高可达一个数量级。
引用
@article{arxiv.2602.03729,
title = {Efficient Training of Boltzmann Generators Using Off-Policy Log-Dispersion Regularization},
author = {Henrik Schopmans and Christopher von Klitzing and Pascal Friederich},
journal= {arXiv preprint arXiv:2602.03729},
year = {2026}
}