中文

ReCo:区域控制的文本到图像生成

计算机视觉与模式识别 2022-11-29 v1

摘要

近年来,大规模文本到图像(T2I)模型在生成高保真图像方面展现出令人印象深刻的性能,但其可控性有限,例如,难以用自由形式的文本描述精确指定特定区域的内容。本文提出了一种用于T2I生成中实现此类区域控制的有效技术。我们为T2I模型的输入增加了一组额外的位置标记,这些标记表示量化的空间坐标。每个区域由四个位置标记指定,分别代表左上角和右下角,后跟一个开放式的自然语言区域描述。然后,我们使用这种新的输入接口微调一个预训练的T2I模型。我们的模型被称为ReCo(区域控制的T2I),它能够对由开放式区域文本描述的任意物体进行区域控制,而非局限于受约束类别集中的物体标签。实验表明,ReCo比通过位置词增强的T2I模型实现了更好的图像质量(在COCO上,FID: 8.82->7.36, SceneFID: 15.54->6.51),同时物体定位更准确,在COCO上的区域分类准确率提高了20.40%。此外,我们证明ReCo能够通过自由形式的区域描述更好地控制物体数量、空间关系以及颜色/尺寸等区域属性。在PaintSkill上的人工评估显示,ReCo在生成具有正确物体数量和空间关系的图像方面,比T2I模型分别准确19.28%和17.21%。

关键词

引用

@article{arxiv.2211.15518,
  title  = {ReCo: Region-Controlled Text-to-Image Generation},
  author = {Zhengyuan Yang and Jianfeng Wang and Zhe Gan and Linjie Li and Kevin Lin and Chenfei Wu and Nan Duan and Zicheng Liu and Ce Liu and Michael Zeng and Lijuan Wang},
  journal= {arXiv preprint arXiv:2211.15518},
  year   = {2022}
}