中文

GeoDiv:测量文本到图像模型中地理多样性的框架

计算机视觉与模式识别 2026-02-26 v1

摘要

文本到图像(T2I)模型正快速流行,但其输出常常缺乏地理多样性、强化刻板印象并误表述地区。鉴于其广泛的覆盖范围,严格评估这些模型如何描绘世界至关重要。现有的多样性指标要么依赖精选数据集,要么仅关注表层视觉相似性,限制了可解释性。我们引入 GeoDiv,一个利用大型语言模型和视觉语言模型评估地理多样性的框架,通过两个互补的轴向进行评估:社会经济视觉指数(SEVI),捕捉经济和条件相关线索;视觉多样性指数(VDI),衡量主要实体和背景的变化。应用于来自 Stable Diffusion 和 FLUX.1-dev 等模型生成的图像,跨 1010 个实体和 1616 个国家,GeoDiv 揭示了持续的多样性不足,并识别了模型默认偏向刻板描绘的细粒度属性。令人惊讶的是,像印度、尼日利亚和哥伦比亚等国家的描绘不成比例地贫困且朴素,反映了潜在的社会经济偏见。这些结果凸显了生成模型中需要更大的地理细微差异。GeoDiv 为衡量此类偏见提供了首个系统、可解释的框架,标志着通往更公平更包容生成系统的一步。项目页面:https://abhipsabasu.github.io/geodiv

关键词

引用

@article{arxiv.2602.22120,
  title  = {GeoDiv: Framework For Measuring Geographical Diversity In Text-To-Image Models},
  author = {Abhipsa Basu and Mohana Singh and Shashank Agnihotri and Margret Keuper and R. Venkatesh Babu},
  journal= {arXiv preprint arXiv:2602.22120},
  year   = {2026}
}

备注

ICLR 2026