中文

RiT:纯净扩散变换器在表示空间中的足矣

计算机视觉与模式识别 2026-05-22 v1

摘要

基于 xx-预测的流匹配技术——即对干净数据点进行回归,而非预测 ambient velocity——已被证明在像素空间中有效利用低维流形结构 \cite{li2025back}。我们询问,是否预训练的表示空间虽包含内在维数相当的低维数据流形,却能提供更适合流匹配学习的分布。我们沿四个几何轴面向像素、SD-VAE 和 DINOv2 特征进行比较,发现像素和 DINOv2 拥有 nearly identical 的内在维数(均为 d^33\hat{d}\approx33),但 DINOv2 的有效秩高出 7.3×7.3\times,协方差条件良好 35×35\times,超峰度降低 11.5×11.5\times,且在流形上插值误差降低 1.7×1.7\times;SD-VAE 潜在变量则始终处于中间水平,表明优势源于表示学习目标而非简单压缩。这些统计特性使流匹配回归问题良好条件化,无需 prior DINOv2 扩散方法中使用的专用预测头或 Riemannian 传输。我们提出了 Representation Image Transformer (RiT):在冻结的 DINOv2 特征上通过 xx-预测训练的纯净 Diffusion Transformer,仅通过尺寸感知噪声计划和 joint [CLS]-patch 建模进行增强。在 ImageNet 256×256256{\times}256 上,RiT 在无引导时达到 FID 1.45,带 classifier-free guidance 时为 1.14,超越 DiTDH^\text{DH}-XL,参数减少 19%19\%(676M vs.\ 839M)。生成的 ODE 在粗糙离散化下即可高效求解:带 classifier-free guidance 时,仅需 55 步 Heun 即可达到 FID 2.0,1010 步可达 1.25,无需蒸馏或一致性训练。代码地址 https://github.com/lezhang7/RiT。

关键词

引用

@article{arxiv.2605.21981,
  title  = {RiT: Vanilla Diffusion Transformers Suffice in Representation Space},
  author = {Le Zhang and Ning Mang and Aishwarya Agrawal},
  journal= {arXiv preprint arXiv:2605.21981},
  year   = {2026}
}