基于表示编码器的流形上学习:解锁标准扩散变压器
机器学习
2026-02-11 v1 计算机视觉与模式识别
摘要
利用表示编码器进行生成建模为高效、高保真合成提供了路径。然而,标准扩散变压器在这些表示上直接训练无法收敛。虽然 recent work 将此归因于容量瓶颈,提出扩散变压器进行计算密集型宽度扩展,但我们表明此问题本质上是几何问题。我们识别出几何干扰(G geometric Interference)作为根本原因:标准欧几里得流匹配将概率路径强制通过特征空间低密度内部,而非沿着流形表面。为解决此问题,我们提出了带雅可比正则化的黎曼流匹配(Riemannian Flow Matching, RJF)。通过将生成过程约束在流形测地线上,并纠正曲率引起的误差传播,RJF 使标准扩散变压器架构无需宽度扩展即可收敛。我们的方法 RJF 使标准 DiT-B 架构(1310 万参数)能够有效收敛,实现 FID 为 3.37,而 prior 方法无法收敛。
引用
@article{arxiv.2602.10099,
title = {Learning on the Manifold: Unlocking Standard Diffusion Transformers with Representation Encoders},
author = {Amandeep Kumar and Vishal M. Patel},
journal= {arXiv preprint arXiv:2602.10099},
year = {2026}
}
备注
Technical Report