中文

GIVL:通过预训练方法提升视觉-语言模型的地理包容性

计算机视觉与模式识别 2023-01-06 v1 人工智能 计算与语言

摘要

AI 发展的一个关键目标是开发服务于所有社群而非仅某一群体需求的技术,无论其地理区域如何。事实上,很大一部分知识由特定地区的人们在本地共享,但因文化差异未必同样适用于其他地区。若模型不了解区域特征,可能导致各地区间性能差异并对代表性不足群体产生偏见。我们提出 GIVL,一个地理包容的视觉-语言预训练模型。地理多样化视觉概念有两个有助于学习地理多样化知识的属性:1) 相似类别下的概念具有独特知识与视觉特征;2) 视觉特征相似的概念可能完全属于不同类别。受这些属性启发,我们设计新的预训练目标图像知识匹配(IKM)与图像编辑检查(IEC)来预训练 GIVL。与以相似规模数据预训练的同类尺寸模型相比,GIVL 在地理多样化视觉-语言任务上取得了最先进(SOTA)且更均衡的性能。

关键词

引用

@article{arxiv.2301.01893,
  title  = {GIVL: Improving Geographical Inclusivity of Vision-Language Models with Pre-Training Methods},
  author = {Da Yin and Feng Gao and Govind Thattai and Michael Johnston and Kai-Wei Chang},
  journal= {arXiv preprint arXiv:2301.01893},
  year   = {2023}
}