中文

像素空间扩散变换器的寄存器token至关重要

计算机视觉与模式识别 2026-05-18 v1

摘要

视觉变换器(ViTs)已知会表现出高范数 patch-token 离群值,影响特征图质量,这一问题可通过'寄存器token'有效缓解。随着扩散模型越来越多地采用变换器架构并向像素空间训练,它们与 ViTs 的形态趋于接近,引发一个问题:寄存器token是否也对扩散变换器(DiTs)有用?本文我们表明,DiTs 与 ViTs 在关键方面存在差异:它们不表现出 patch-token 离群值。有趣的是,寄存器token显著改善了像素空间 DiTs 的收敛和生成质量。通过分析中间表示,我们发现寄存器token在高噪声水平下产生更干净的特征图,这可能对其在像素空间生成中的有效性有贡献。我们进一步观察到,最近的像素空间 DiT 架构隐式包含类似寄存器token的机制,这可能部分解释了其强大的实证性能。受此启发,我们探讨一种参数高效的双流架构,专门处理寄存器token,提高像素空间生成质量,同时几乎没有运行时开销。

关键词

引用

@article{arxiv.2605.16147,
  title  = {Registers Matter for Pixel-Space Diffusion Transformers},
  author = {Nikita Starodubcev and Ilia Sudakov and Ilya Drobyshevskiy and Artem Babenko and Dmitry Baranchuk},
  journal= {arXiv preprint arXiv:2605.16147},
  year   = {2026}
}