HyperDiT:用于高保真像素空间扩散的超连接Transformer
计算机视觉与模式识别
2026-05-18 v1
摘要
像素空间扩散模型绕过了变分自编码器(VAE)的重构瓶颈,但面临根本性的"粒度困境":捕获全局语义有利于大块尺度,而生成高保真细节则需要细粒度输入。为此,我们提出HyperDiT,一个统一框架,建立超连接跨尺度互动,以桥接语义与像素流形。不同于通过AdaLN注入语义,HyperDiT利用Cross-Attention机制,使细粒度标记能够全局查询多级语义锚点。为解决多尺度互动中的空间不匹配问题,我们引入Scale-Aware Rotary Position Embedding(SA-RoPE),确保不同patch大小标记之间实现精确的几何对齐。此外,我们纳入Registers来学习来自预训练视觉基础模型(VFM)的稠密语义,从而有效减少生成幻觉和伪影。大量实验表明,HyperDiT在ImageNet 像素空间直接实现了SoTA FID \mathbf{1.56。通过将细粒度流与语义指导相结合,HyperDiT为高保真像素生成提供了更优范式。
引用
@article{arxiv.2605.15741,
title = {HyperDiT: Hyper-Connected Transformers for High-Fidelity Pixel-Space Diffusion},
author = {Yu He and Lichen Ma and Zipeng Guo and Xinyuan Shan and Jingling Fu and Dong Chen and Junshi Huang and Yan Li},
journal= {arXiv preprint arXiv:2605.15741},
year = {2026}
}