基于富文本的表达性文本到图像生成
计算机视觉与模式识别
2025-01-16 v4 图形学
机器学习
摘要
纯文本已成为文本到图像合成的主流接口。然而,其有限的定制选项阻碍用户准确描述期望输出。例如,纯文本难以指定连续量,如精确的 RGB 颜色值或每个词的重要性。此外,为人类编写复杂场景的详细文本提示繁琐,且文本编码器难以解读。为应对这些挑战,我们提议使用支持字体样式、大小、颜色与脚注等格式的富文本编辑器。我们从富文本中提取每个词的属性,以实现局部风格控制、显式词符重加权、精确颜色渲染与详细区域合成。我们通过基于区域的扩散过程实现这些能力。我们首先基于纯文本扩散过程的注意力图获得每个词的区域。对每个区域,我们通过创建区域特定的详细提示并施加区域特定引导来强制其文本属性,并通过基于区域的注入保持相对于纯文本生成的保真度。我们展示了富文本图像生成的多个示例,并证明我们的方法在定量评估上优于强基线。
引用
@article{arxiv.2304.06720,
title = {Expressive Text-to-Image Generation with Rich Text},
author = {Songwei Ge and Taesung Park and Jun-Yan Zhu and Jia-Bin Huang},
journal= {arXiv preprint arXiv:2304.06720},
year = {2025}
}
备注
Project webpage: https://rich-text-to-image.github.io/