RiT:纯净扩散变换器在表示空间中的足矣
计算机视觉与模式识别
2026-05-22 v1
摘要
基于 -预测的流匹配技术——即对干净数据点进行回归,而非预测 ambient velocity——已被证明在像素空间中有效利用低维流形结构 \cite{li2025back}。我们询问,是否预训练的表示空间虽包含内在维数相当的低维数据流形,却能提供更适合流匹配学习的分布。我们沿四个几何轴面向像素、SD-VAE 和 DINOv2 特征进行比较,发现像素和 DINOv2 拥有 nearly identical 的内在维数(均为 ),但 DINOv2 的有效秩高出 ,协方差条件良好 ,超峰度降低 ,且在流形上插值误差降低 ;SD-VAE 潜在变量则始终处于中间水平,表明优势源于表示学习目标而非简单压缩。这些统计特性使流匹配回归问题良好条件化,无需 prior DINOv2 扩散方法中使用的专用预测头或 Riemannian 传输。我们提出了 Representation Image Transformer (RiT):在冻结的 DINOv2 特征上通过 -预测训练的纯净 Diffusion Transformer,仅通过尺寸感知噪声计划和 joint [CLS]-patch 建模进行增强。在 ImageNet 上,RiT 在无引导时达到 FID 1.45,带 classifier-free guidance 时为 1.14,超越 DiT-XL,参数减少 (676M vs.\ 839M)。生成的 ODE 在粗糙离散化下即可高效求解:带 classifier-free guidance 时,仅需 步 Heun 即可达到 FID 2.0, 步可达 1.25,无需蒸馏或一致性训练。代码地址 https://github.com/lezhang7/RiT。
引用
@article{arxiv.2605.21981,
title = {RiT: Vanilla Diffusion Transformers Suffice in Representation Space},
author = {Le Zhang and Ning Mang and Aishwarya Agrawal},
journal= {arXiv preprint arXiv:2605.21981},
year = {2026}
}