中文

不精确生成模型如何仍能从数据流形上采样

机器学习 2025-08-12 v1 动力系统 概率论

摘要

观察到某些动力学生成模型中出现一种奇特现象:尽管在评估函数或漂移向量场上存在学习误差,生成的样本仍似乎沿着数据分布的 support 方向移动,而非向外移动。在本文中,我们采用动力学系统方法来研究 support 鲁棒性现象。我们对概率流的扰动分析表明,对于广泛的生成模型类,微小的学习误差仅导致预测密度与目标密度在数据流形上不同。进一步,我们探讨了导致 support 鲁棒性的动力学机制:我们表明,顶 Lyapunov 向量(最敏感的微小扰动方向)与数据流形边界切向空间的对齐是实现鲁棒性的关键。我们还证明了实现这种对齐的生成过程动力学的充分条件。此外,对齐条件易于计算,在实际情况下,对于鲁棒的生成模型,自动导致对数据流形切丝束的准确估计。我们对样本路径和概率流进行有限时线性扰动分析,该工作补充并扩展了现有工作,旨在从随机分析、统计学习和不确定性量化角度为生成模型提供理论保证。我们的结果适用于各种动力学生成模型,如条件 flow-matching 和基于评估的生成模型,以及各种目标分布,这些分布可能满足或不满足流形假设。

关键词

引用

@article{arxiv.2508.07581,
  title  = {When and how can inexact generative models still sample from the data manifold?},
  author = {Nisha Chandramoorthy and Adriaan de Clercq},
  journal= {arXiv preprint arXiv:2508.07581},
  year   = {2025}
}