中文

CEIDM:用于增强文本到图像生成的受控实体与交互扩散模型

计算机视觉与模式识别 2025-08-26 v1 计算与语言

摘要

在文本到图像(T2I)生成中,实体及其复杂交互构成了T2I基于扩散模型的方法面临的重大挑战:如何有效控制实体及其交互以产生高质量图像。为此,我们提出了CEIDM,一种基于扩散模型的图像生成方法,采用双重控制机制来控制实体与交互。首先,我们提出了基于大型语言模型(LLM)的实体交互关系挖掘方法,通过链式思考提取合理且丰富的隐式交互关系,以引导扩散模型生成更贴近真实逻辑且交互关系更合理的高质量图像。此外,我们提出了交互动作聚类与偏移方法,对每个文本提示中包含的交互动作特征进行聚类与偏移。通过构建全局和局部的双向偏移,我们增强了原始动作的语义理解与细节补充,使模型对交互"动作"概念的理解更加准确,从而生成交互动作更精确的图像。最后,我们设计了实体控制网络,生成带有实体语义引导的掩码,然后利用多尺度卷积网络增强实体特征,并采用动态网络融合特征。这有效地控制了实体,显著提升了图像质量。实验表明,所提出的CEIDM方法在实体控制及其交互控制方面均优于最具代表性的现有方法。

关键词

引用

@article{arxiv.2508.17760,
  title  = {CEIDM: A Controlled Entity and Interaction Diffusion Model for Enhanced Text-to-Image Generation},
  author = {Mingyue Yang and Dianxi Shi and Jialu Zhou and Xinyu Wei and Leqian Li and Shaowu Yang and Chunping Qiu},
  journal= {arXiv preprint arXiv:2508.17760},
  year   = {2025}
}