中文

无过滤:对比视觉语言模型中的文化和社会经济多样性

计算机视觉与模式识别 2024-10-25 v3 人工智能

摘要

我们研究了对比视觉语言模型(VLM)中的文化和社会经济多样性。通过使用广泛的基准数据集和评估指标,我们提出了几个重要发现。首先,将训练数据过滤为英文图像-文本对的做法不利于社会经济地位较低的社区,并对文化理解产生负面影响。值得注意的是,这种性能差距并未被当前流行的、源自以西方为中心的ImageNet和COCO数据集的评估指标所捕捉,甚至与之相悖。其次,在针对英文内容进行微调之前,使用全局、未过滤的数据进行预训练可以提高文化理解,而不会牺牲在上述流行基准上的性能。第三,我们引入了地理定位任务作为评估VLM文化多样性的新指标。我们的工作强调了使用多样化数据创建更具包容性的多模态系统的价值,并为开发更好地代表全球视角的VLM奠定了基础。

关键词

引用

@article{arxiv.2405.13777,
  title  = {No Filter: Cultural and Socioeconomic Diversity in Contrastive Vision-Language Models},
  author = {Angéline Pouget and Lucas Beyer and Emanuele Bugliarello and Xiao Wang and Andreas Peter Steiner and Xiaohua Zhai and Ibrahim Alabdulmohsin},
  journal= {arXiv preprint arXiv:2405.13777},
  year   = {2024}
}

备注

17 pages, 5 figures, 4 tables. 38th Conference on Neural Information Processing Systems (NeurIPS 2024)