中文

Alfie:零成本实现 RGBA 图像生成民主化

计算机视觉与模式识别 2024-08-28 v1 多媒体

摘要

设计和艺术作品在各种创意领域中无处不在,创作包含徽标、图标、符号和艺术场景等众多图形元素的构图需要平面设计技能和专用软件,而这些元素是视觉叙事不可或缺的部分。自动化生成此类视觉元素可提高平面设计师的生产力,使创意产业民主化并推动创新,同时有助于为相关任务生成更逼真的合成数据。这些插画元素大多为具有不规则形状和裁剪区域的 RGBA 图像,便于混合和场景合成。然而,大多数图像生成模型无法生成此类图像,而实现这一能力需要昂贵的计算资源、特定的训练方案或后处理解决方案。在这项工作中,我们提出了一种全自动方法,通过修改预训练扩散 Transformer 模型在推理时的行为来获取 RGBA 插画,利用此类模型提供的提示引导可控性和视觉质量,且无需额外计算成本。我们强制生成没有锐利裁剪的完整主体,其背景易于移除,以便无缝集成到设计项目或艺术场景中。我们通过用户研究表明,在大多数情况下,用户更喜欢我们的解决方案,而非先生成图像再进行抠图,并且我们生成的插画在用作合成场景生成流程的输入时能产生良好效果。我们在 https://github.com/aimagelab/Alfie 上发布了代码。

关键词

引用

@article{arxiv.2408.14826,
  title  = {Alfie: Democratising RGBA Image Generation With No $$$},
  author = {Fabio Quattrini and Vittorio Pippi and Silvia Cascianelli and Rita Cucchiara},
  journal= {arXiv preprint arXiv:2408.14826},
  year   = {2024}
}

备注

Accepted at ECCV AI for Visual Arts Workshop and Challenges