中文

CuRe:文本到图像系统中文化缺失的深度尾部分析

计算机视觉与模式识别 2025-06-11 v1

摘要

流行的文本到图像(T2I)系统是在网络爬取数据上训练的,该数据以美洲和欧洲为中心,未能充分代表全球南方的文化。为分析这些偏见,我们引入了 CuRe,这是一个新型且可扩展的文化代表性基准和评分套件,利用属性指定对 T2I 系统的边际效用作为人类判断的代理。我们的 CuRe 基准数据集拥有新颖的分类层级结构,源自众包式维基百科知识图谱,包含 300 个文化遗产,涵盖 32 个文化子类别,归类为六大文化轴(食物、艺术、时尚、建筑、庆典和人物)。我们的数据集分类层级结构使 CuRe 评分器能够通过分析其对文本条件信息增强程度的响应,从而对 T2I 系统进行细粒度的文化比较。我们经验性地观察到,针对多种图像编码器(SigLIP 2、AIMV2 和 DINOv2)、视觉语言模型(OpenCLIP、SigLIP 2、Gemini 2.0 Flash)以及最先进的文本到图像系统(包括三种 Stable Diffusion 变体 1.5、XL、3.5 Large、FLUX.1 [dev]、Ideogram 2.0 和 DALL-E 3),我们的评分器与人类感知相似性、图像文本对齐和文化多样性判断的相关性显著更强。代码和数据集已开源,地址为 https://aniketrege.github.io/cure/。

关键词

引用

@article{arxiv.2506.08071,
  title  = {CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems},
  author = {Aniket Rege and Zinnia Nie and Mahesh Ramesh and Unmesh Raskar and Zhuoran Yu and Aditya Kusupati and Yong Jae Lee and Ramya Korlakai Vinayak},
  journal= {arXiv preprint arXiv:2506.08071},
  year   = {2025}
}

备注

41 pages, 22 figures, 17 tables