中文

ArtAug:通过合成-理解交互增强文本到图像生成

计算机视觉与模式识别 2024-12-19 v2 人工智能

摘要

扩散模型的出现显著推进了图像合成。最近关于大语言模型中模型交互和自我纠正推理方法的研究为增强文本到图像模型提供了新的见解。受这些研究的启发,我们在本文中提出了一种名为ArtAug的新方法,用于增强文本到图像模型。据我们所知,ArtAug是第一个通过模型与理解模型的交互来改进图像合成模型的方法。在交互中,我们利用图像理解模型隐式学习的人类偏好,为图像合成模型提供细粒度的建议。交互可以修改图像内容使其美观,例如调整曝光、改变拍摄角度和添加大气效果。交互带来的增强通过一个额外的增强模块迭代地融合到合成模型本身中。这使得合成模型能够直接产生美观的图像,而无需任何额外的计算成本。在实验中,我们在现有的文本到图像模型上训练ArtAug增强模块。各种评估指标一致表明,ArtAug增强了文本到图像模型的生成能力,且不增加额外计算成本。源代码和模型将公开发布。

关键词

引用

@article{arxiv.2412.12888,
  title  = {ArtAug: Enhancing Text-to-Image Generation through Synthesis-Understanding Interaction},
  author = {Zhongjie Duan and Qianyi Zhao and Cen Chen and Daoyuan Chen and Wenmeng Zhou and Yaliang Li and Yingda Chen},
  journal= {arXiv preprint arXiv:2412.12888},
  year   = {2024}
}

备注

18 pages, 8 figures