中文

无穷与超越:VAR 与扩散 T2I 模型中的组合对齐

计算机视觉与模式识别 2026-03-17 v2

摘要

实现文本描述与生成图像之间的组合对齐——涵盖对象、属性和空间关系——仍然是现代文本到图像(T2I)模型面临的核心挑战。尽管基于扩散的架构已被广泛研究,但新兴的视觉自回归(VAR)模型的组合行为在很大程度上仍未被考察。我们在完整的 T2I-CompBench++ 和 GenEval 套件上对六个不同的 T2I 系统——SDXL、PixArt-α\alpha、Flux-Dev、Flux-Schnell、Infinity-2B 和 Infinity-8B——进行了基准测试,评估了在颜色与属性绑定、空间关系、数值感知以及复杂多对象提示方面的对齐情况。在这两个基准测试中,Infinity-8B 实现了最强的整体组合对齐,而 Infinity-2B 在多个类别中也匹配或超越了更大的扩散模型,凸显了有利的效率-性能权衡。相比之下,SDXL 和 PixArt-α\alpha 在属性敏感和空间任务中表现出持续的弱点。这些结果提供了对 VAR 与扩散方法在组合对齐上的首次系统比较,并为 T2I 模型的未来发展确立了统一基准。

关键词

引用

@article{arxiv.2512.11542,
  title  = {Infinity and Beyond: Compositional Alignment in VAR and Diffusion T2I Models},
  author = {Hossein Shahabadi and Niki Sepasian and Arash Marioriyad and Ali Sharifi-Zarchi and Mahdieh Soleymani Baghshah},
  journal= {arXiv preprint arXiv:2512.11542},
  year   = {2026}
}

备注

Accepted at the ICLR 2026 Workshop on Multimodal Intelligence: Next Token Prediction and Beyond