重新思考多模态扩散变压器中的跨模态交互
计算机视觉与模式识别
2025-07-24 v3
摘要
多模态扩散变压器 (MM-DiTs) 在文本驱动视觉生成方面取得了显著进展。然而,即便是像 FLUX 等最先进的 MM-DiT 模型,也在文本提示与生成内容之间实现精确对齐方面存在挑战。我们确定了 MM-DiT 注意力机制中的两个关键问题:1) 由于视觉模态与文本模态之间的 token 失衡导致的跨模态注意力抑制;2) 缺乏基于时间步的注意力加权,阻碍了对齐。为解决这些问题,我们提出了 Temperature-Adjusted Cross-modal Attention (TACA),这是一种参数高效的方法,通过温度缩放和基于时间步的调整动态重新平衡模态间的交互。当结合 LoRA 微调时,TACA 在 T2I-CompBench 基准上显著提升了文本-图像对齐性能,同时几乎没有增加计算开销。我们在 FLUX 和 SD3.5 等最先进模型上测试了 TACA,证明了其在对象外观、属性绑定和空间关系方面提升图像-文本对齐能力的能力。我们的发现凸显了在提高文本到图像扩散模型语义保真度方面,平衡跨模态注意力的重要性。我们的代码已公开于 https://github.com/Vchitect/TACA。
引用
@article{arxiv.2506.07986,
title = {Rethinking Cross-Modal Interaction in Multimodal Diffusion Transformers},
author = {Zhengyao Lv and Tianlin Pan and Chenyang Si and Zhaoxi Chen and Wangmeng Zuo and Ziwei Liu and Kwan-Yee K. Wong},
journal= {arXiv preprint arXiv:2506.07986},
year = {2025}
}
备注
Accepted by ICCV 2025; Project Page: https://vchitect.github.io/TACA/