中文

SCoFT:用于公平图像生成的自对比微调

计算机视觉与模式识别 2024-01-17 v1

摘要

众所周知,媒体中的准确表征能改善受众的福祉。在如 LAION 等大型网络爬取数据集上训练的生成式图像模型,已知会产生带有有害刻板印象和文化误读图像。我们通过以下方式改善生成图像中的包容性表征:(1) 与社区合作收集一个具有文化代表性的数据集,我们称之为跨文化理解基准 (Cross-Cultural Understanding Benchmark, CCUB);(2) 提出一种新颖的自对比微调 (Self-Contrastive Fine-Tuning, SCoFT) 方法,利用模型已知的偏见进行自我改进。SCoFT 旨在防止在小数据集上过拟合,仅从数据中编码高层信息,并将生成分布从预训练模型中编码的误读移开。我们基于 51 名来自 5 个不同国家的参与者根据其自选的国家文化归属进行的用户研究表明,与 Stable Diffusion 基线相比,在 CCUB 上微调 consistently 生成的图像具有更高的文化相关性和更少的刻板印象,而我们的 SCoFT 技术进一步改善了这一结果。

关键词

引用

@article{arxiv.2401.08053,
  title  = {SCoFT: Self-Contrastive Fine-Tuning for Equitable Image Generation},
  author = {Zhixuan Liu and Peter Schaldenbrand and Beverley-Claire Okogwu and Wenxuan Peng and Youngsik Yun and Andrew Hundt and Jihie Kim and Jean Oh},
  journal= {arXiv preprint arXiv:2401.08053},
  year   = {2024}
}