中文

基于表示编码器的流形上学习:解锁标准扩散变压器

机器学习 2026-02-11 v1 计算机视觉与模式识别

摘要

利用表示编码器进行生成建模为高效、高保真合成提供了路径。然而,标准扩散变压器在这些表示上直接训练无法收敛。虽然 recent work 将此归因于容量瓶颈,提出扩散变压器进行计算密集型宽度扩展,但我们表明此问题本质上是几何问题。我们识别出几何干扰(G geometric Interference)作为根本原因:标准欧几里得流匹配将概率路径强制通过特征空间低密度内部,而非沿着流形表面。为解决此问题,我们提出了带雅可比正则化的黎曼流匹配(Riemannian Flow Matching, RJF)。通过将生成过程约束在流形测地线上,并纠正曲率引起的误差传播,RJF 使标准扩散变压器架构无需宽度扩展即可收敛。我们的方法 RJF 使标准 DiT-B 架构(1310 万参数)能够有效收敛,实现 FID 为 3.37,而 prior 方法无法收敛。

关键词

引用

@article{arxiv.2602.10099,
  title  = {Learning on the Manifold: Unlocking Standard Diffusion Transformers with Representation Encoders},
  author = {Amandeep Kumar and Vishal M. Patel},
  journal= {arXiv preprint arXiv:2602.10099},
  year   = {2026}
}

备注

Technical Report