中文

论文本到图像生成中的文化鸿沟

计算机视觉与模式识别 2023-07-07 v1 人工智能 计算与语言

摘要

文本到图像 (T2I) 生成中的一个挑战是训练数据中无意反映的文化鸿沟,即当下输入文本的文化元素在训练集中极少被收集时,所生成图像质量存在差距。尽管各种 T2I 模型已展示出令人印象深刻但随机的示例,目前仍缺乏系统评估 T2I 模型生成跨文化图像能力的基准。为弥补这一差距,我们提出一个具有综合评估准则的具有挑战性的跨文化 (C3) 基准,可评估模型对目标文化的适应程度。通过分析 Stable Diffusion 模型在 C3 基准上生成的缺陷图像,我们发现该模型常无法生成某些文化物件。据此,我们提出一种考虑物体-文本对齐的新颖多模态度量,用以筛选目标文化中的微调数据,并用于微调 T2I 模型以改善跨文化生成。实验结果表明,我们的多模态度量在 C3 基准上比现有度量提供更强的数据选择性能,其中物体-文本对齐至关重要。我们发布了基准、数据、代码及生成图像,以促进未来关于文化多样性 T2I 生成的研究 (https://github.com/longyuewangdcu/C3-Bench)。

关键词

引用

@article{arxiv.2307.02971,
  title  = {On the Cultural Gap in Text-to-Image Generation},
  author = {Bingshuai Liu and Longyue Wang and Chenyang Lyu and Yong Zhang and Jinsong Su and Shuming Shi and Zhaopeng Tu},
  journal= {arXiv preprint arXiv:2307.02971},
  year   = {2023}
}

备注

Equal contribution: Bingshuai Liu and Longyue Wang. Work done while Bingshuai Liu and Chengyang Lyu were interning at Tencent AI Lab. Zhaopeng Tu is the corresponding author