中文

CreativeSynth:基于多模态扩散与跨艺术注意力的艺术图像合成

计算机视觉与模式识别 2025-05-16 v3 人工智能

摘要

尽管图像风格迁移取得了显著进展,但风格只是艺术绘画的组成部分之一。将提取的风格特征直接迁移到自然图像上,往往会导致输出结果带有明显的合成痕迹。这是因为包括布局、透视、形状和语义在内的关键绘画属性通常无法通过风格迁移来传达和表达。大规模预训练文本到图像生成模型已展现出合成大量高质量图像的能力。然而,即使有详尽的文本描述,也难以充分表达绘画独特的视觉特性和细节。此外,通用模型在修改特定区域时往往会破坏整体艺术效果,使得在艺术品中实现统一的美学变得更加复杂。我们的主要新思想是将多模态语义信息作为合成指导整合到艺术品中,而不是将风格迁移到现实世界。我们还旨在简化指导条件的同时,减少对艺术品和谐性的破坏。具体而言,我们提出了一种名为 CreativeSynth 的创新多任务统一框架,该框架基于具有协调多模态输入能力的扩散模型。CreativeSynth 将多模态特征与定制的注意力机制相结合,通过跨艺术注意力进行美学维护和语义融合,将现实世界的语义内容无缝整合到艺术领域。我们展示了该方法在广泛的不同艺术类别上的结果,证明 CreativeSynth 弥合了生成模型与艺术表达之间的差距。代码和结果可在 https://github.com/haha-lisa/CreativeSynth 获取。

关键词

引用

@article{arxiv.2401.14066,
  title  = {CreativeSynth: Cross-Art-Attention for Artistic Image Synthesis with Multimodal Diffusion},
  author = {Nisha Huang and Weiming Dong and Yuxin Zhang and Fan Tang and Ronghui Li and Chongyang Ma and Xiu Li and Tong-Yee Lee and Changsheng Xu},
  journal= {arXiv preprint arXiv:2401.14066},
  year   = {2025}
}