中文

增强面向相似主题生成的MMDiT文本到图像模型

计算机视觉与模式识别 2024-11-28 v1

摘要

代表着文本到图像模型的最新技术,Multimodal Diffusion Transformer(MMDiT)大幅缓解了先前模型中存在的许多生成问题。然而,我们发现它在输入文本提示包含多个语义或外观相似主题时仍会出现主题忽视或混合问题。我们识别出MMDiT架构中导致此问题的三个可能歧义:跨块歧义、文本编码器歧义以及语义歧义。为解决这些问题,我们提出在早期去噪步骤中对含糊的潜在表示进行即时修复。具体而言,我们设计了三个损失函数:块对齐损失、文本编码器对齐损失以及重叠损失,每一个都针对缓解这些歧义。尽管取得了显著的改进,我们仍注意到在生成多个相似主题时语义歧义仍然存在,因为重叠损失提供的指导不够明确。因此,我们进一步提出了重叠在线检测和回到起点抽样策略来缓解此问题。在新构建的具有挑战性的相似主题数据集上的实验结果验证了我们方法的有效性,显示出优越的生成质量和 much higher 成功率,超越了现有方法。我们的代码将在https://github.com/wtybest/EnMMDiT上公开。

关键词

引用

@article{arxiv.2411.18301,
  title  = {Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation},
  author = {Tianyi Wei and Dongdong Chen and Yifan Zhou and Xingang Pan},
  journal= {arXiv preprint arXiv:2411.18301},
  year   = {2024}
}