中文

场景图适配器:利用场景图引导提升文本到图像生成效果

计算机视觉与模式识别 2024-05-27 v1

摘要

文本到图像生成的最新进展得益于扩散模型和多模态学习的发展。然而,由于这些模型中文本通常以顺序方式表示,往往难以提供准确的上下文化处理和结构控制,导致生成图像在特别是涉及多个物体和关系的复杂场景时,难以符合人类的预期。在本文中,我们引入了场景图适配器(SG-Adapter),通过利用场景图的结构化表示来纠正原始文本嵌入中的不准确之处。SG-Adapter所采用的显式且非完全连接的图表示,大大改善了基于Transformer的文本表示方式,这一改进在维持多个关系中精确对应关系方面尤为显著。为了解决Visual Genome等低质量标注数据集带来的挑战,我们手动构建了一个高质量的、多关系场景图-图像配对数据集MultiRels。此外,我们设计了三个基于GPT-4V的指标,有效且全面地衡量图像与场景图之间的对应关系。定性和定量结果均验证了我们方法在控制多个关系对应方面的有效性。

关键词

引用

@article{arxiv.2405.15321,
  title  = {SG-Adapter: Enhancing Text-to-Image Generation with Scene Graph Guidance},
  author = {Guibao Shen and Luozhou Wang and Jiantao Lin and Wenhang Ge and Chaozhe Zhang and Xin Tao and Yuan Zhang and Pengfei Wan and Zhongyuan Wang and Guangyong Chen and Yijun Li and Ying-Cong Chen},
  journal= {arXiv preprint arXiv:2405.15321},
  year   = {2024}
}