分数匹配的统计效率:来自等周性的视角
机器学习
2022-12-26 v2 统计理论
机器学习
统计理论
摘要
由归一化常数参数化至某一程度的深度生成模型(如基于能量的模型)难以通过最大化数据似然来训练,因为似然及/或其梯度无法被显式或高效地写出。分数匹配是一种训练方法,其不拟合训练数据的似然 ,而是拟合分数函数 ——从而免除了对配分函数的求值。尽管该估计量已知是一致的,但其统计效率是否(以及在何时)可与最大似然——已知(渐近)最优——相媲美仍不明确。我们在本文中开启这一探究线索,并揭示分数匹配的统计效率与所估计分布的等周性质——即 Poincar\'e 常数、对数 Sobolev 常数与等周常数——之间的紧密关联,这些量支配着如朗之万动力学等马尔可夫过程的混合时间。粗略地说,我们表明当分布具有较小的等周常数时,分数匹配估计量在统计上可与最大似然相比拟。反之,若分布具有较大的等周常数——即便对于如具有足够丰富充分统计量的指数族这类简单分布族——分数匹配的效率将大幅低于最大似然。我们在有限样本情形与渐近情形下分别对结果作了恰当的形式化。最后,我们在离散情形中辨识出一处直接对应,将伪似然估计的统计性质与熵的近似张量化及 Glauber 动力学相联系。
引用
@article{arxiv.2210.00726,
title = {Statistical Efficiency of Score Matching: The View from Isoperimetry},
author = {Frederic Koehler and Alexander Heckett and Andrej Risteski},
journal= {arXiv preprint arXiv:2210.00726},
year = {2022}
}