中文

流匹配抽样器的隐含偏差研究

机器学习 2026-05-15 v3 机器学习 概率论

摘要

流匹配(Flow Matching, FM)通过为基分布与目标分布之间建立概率路径来构建连续时间ODE抽样器。本文通过有限样本插值估计的视角研究FM。除了将population期望替换为样本平均外,还可将目标分布本身替换为有限样本近似值,从经验分布到平滑估计器。这一视角构建了一系列经验FM模型的自然层次结构。对于仿射条件流,我们推导了精确的经验最小化器,并识别出一种平滑插值范例,其中终端分布恰好是核密度估计器。该插值视角阐明了经验FM的若干耦合有限样本偏差:第一,替换目标分布会改变统计目标;第二,经验最小化器通常不是梯度场,即使每个条件流都是;第三,固定的经验边缘路径并不唯一确定粒子动力学:可添加额外向量场,其概率通量的散度为零而不改变边缘路径。对于高斯仿射条件路径,我们给出明确的通量为零校正方案。最后,源分布是控制动能上尾部的主要机制。具体而言,高斯基分布可实现瞬时动能和积分动能的指数上尾界,而多项式尾部基分布则可实现相应的多项式上尾界。

关键词

引用

@article{arxiv.2512.16768,
  title  = {On The Hidden Biases of Flow Matching Samplers},
  author = {Soon Hoe Lim},
  journal= {arXiv preprint arXiv:2512.16768},
  year   = {2026}
}

备注

41 pages