中文

利用跨文化理解基准(CCUB)数据集实现文本到图像合成模型中的公平表征

计算机视觉与模式识别 2023-04-27 v2

摘要

已有研究表明,媒体中的准确表征可改善受众的福祉。相反,不准确的表征会对观众产生负面影响,并导致对其他文化的有害认知。为实现生成图像中的包容性表征,我们提出了一种文化感知的 priming 方法用于文本到图像合成,使用我们收集的小型但经文化策划的数据集(此处称为跨文化理解基准(CCUB)数据集)来对抗巨型数据集中普遍存在的偏见。我们提出的方法由两种微调技术组成:(1)通过在 CCUB 文本-图像对上微调预训练的文本到图像合成模型 Stable Diffusion 来添加视觉上下文;(2)通过使用在我们 CCUB 文化感知文本数据上微调的大语言模型 GPT-3 进行自动提示工程来添加语义上下文。CCUB 数据集经过策划,且我们的方法由与该特定文化有个人关系的人评估。我们的实验表明,同时使用文本与图像的 priming 在保持质量的同时,能有效提升生成图像的文化相关性并降低冒犯性。

关键词

引用

@article{arxiv.2301.12073,
  title  = {Towards Equitable Representation in Text-to-Image Synthesis Models with the Cross-Cultural Understanding Benchmark (CCUB) Dataset},
  author = {Zhixuan Liu and Youeun Shin and Beverley-Claire Okogwu and Youngsik Yun and Lia Coleman and Peter Schaldenbrand and Jihie Kim and Jean Oh},
  journal= {arXiv preprint arXiv:2301.12073},
  year   = {2023}
}

备注

Still on going work