图像来源何处?基于标题分析数据集的地理轮廓化
计算机视觉与模式识别
2026-02-11 v1
摘要
近期研究表明,文本到图像模型常常生成不具代表性的地理图像,这引发了对训练数据代表性的疑虑,并催生了这样一个问题:这些训练示例来自哪些世界地区?我们通过将图像-标题对映射到国家(基于从标题中提取的地理信息,使用大语言模型)来对大规模多模态数据集进行地理轮廓化。在涵盖20个常见实体(如房屋、旗帜)的三个广泛使用的公开数据集(Re-LAION、DataComp1B和Conceptual Captions)的英文标题中,我们发现美国、英国和加拿大占样本的48.0%,而南美和非洲国家严重不足,分别仅占1.8%和3.8%。我们观察到国家GDP与其在数据中的代表性之间存在强相关性(ρ = 0.82)。检查Re-LAION数据集中4种非英语言子集时,发现代表性严重倾向于这些语言主要使用的国家。此外,我们发现更高的代表性并不一定转化为更大的视觉或语义多样性。最后,我们分析了在Re-LAION上训练的Stable Diffusion v1.3生成的国家专属图像,表明虽然生成的图像看起来真实,但其覆盖范围严格限制于真实世界图像。
引用
@article{arxiv.2602.09775,
title = {Where Do Images Come From? Analyzing Captions to Geographically Profile Datasets},
author = {Abhipsa Basu and Yugam Bahl and Kirti Bhagat and Preethi Seshadri and R. Venkatesh Babu and Danish Pruthi},
journal= {arXiv preprint arXiv:2602.09775},
year = {2026}
}
备注
41 pages, 20 figures