扩散 Transformer 中空间关系生成的电路机制
人工智能
2026-04-07 v2 计算机视觉与模式识别
机器学习
摘要
扩散 Transformer (DiT) 在文本到图像生成方面取得了显著进展,但模型仍在生成文本提示中指定的对象之间的正确空间关系方面存在挑战。本研究采用机制可解释性方法来探究 DiT 如何生成对象之间的正确空间关系。我们从头训练了不同大小的 DiT 以及不同文本编码器,以学习生成包含两个具有特定属性和空间关系的图像。我们发现,尽管所有模型都能实现近乎完美的准确率,但底层机制因文本编码器的选择而大不相同。使用随机文本嵌入时,我们发现空间关系信息通过两个交叉注意力头依次传递给图像 token——分别读取文本提示中的空间关系和单对象属性。使用预训练文本编码器 (T5) 时,我们发现 DiT 使用不同的电路,利用文本 token 中的信息融合,同时从单个文本 token 中读取空间关系和单对象信息。我们进一步表明,尽管两种设置在领域内性能相似,但其对域外扰动的鲁棒性不同,这可能暗示了在实际场景中生成正确关系的难度。
引用
@article{arxiv.2601.06338,
title = {Circuit Mechanisms for Spatial Relation Generation in Diffusion Transformers},
author = {Binxu Wang and Jingxuan Fan and Xu Pan},
journal= {arXiv preprint arXiv:2601.06338},
year = {2026}
}
备注
45 pages, 30 figures, accepted in CVPR 2026