中文

条件嵌入扩散 Transformer 中的隐藏语义瓶颈

计算机视觉与模式识别 2026-02-26 v1

摘要

扩散 Transformer 已在 class-conditional 和多模态生成中取得最先进性能,但其学习到的条件嵌入结构仍鲜有人了解。在本工作中,我们对这些嵌入进行首次系统性研究,发现显著的冗余:class 条件嵌入在 ImageNet-1K 上显示出极端的角度相似性,超过 99%;而连续条件任务(如姿态引导图像生成和视频到音频生成)则达到 99.9%。我们进一步发现,语义信息集中于少数维子中,head 维承担主要信号,tail 维贡献微弱。通过修剪低幅值维度——可移除至三分之二的嵌入空间——我们表明生成质量和忠实度基本不受影响,甚至在某些情况下得到提升。这些结果揭示了基于 Transformer 的扩散模型中的语义瓶颈,为如何编码语义提供新见解,并暗示了更高效条件机制的潜在机遇。

关键词

引用

@article{arxiv.2602.21596,
  title  = {A Hidden Semantic Bottleneck in Conditional Embeddings of Diffusion Transformers},
  author = {Trung X. Pham and Kang Zhang and Ji Woo Hong and Chang D. Yoo},
  journal= {arXiv preprint arXiv:2602.21596},
  year   = {2026}
}

备注

Accepted to ICLR 2026