中文

Babel-ImageNet:视觉与语言表示的大规模多语言评测

计算与语言 2024-06-13 v2 计算机视觉与模式识别

摘要

采用各模态独立编码器(如 CLIP)的视觉与语言(VL)模型已成为零样本图像分类与图文检索的首选模型。然而,它们大多仅在英语下评测,因为多语言基准的可得性有限。我们提出 Babel-ImageNet,一个大规模多语言基准,将 ImageNet 标签(部分)翻译为 100 种语言,且无需机器翻译或人工标注。我们转而通过共享的 WordNet 同义词集将其链接到大规模多语言词汇语义网络 BabelNet,从而自动获得可靠翻译。我们在该基准上评测了 11 个公开多语言 CLIP 模型在零样本图像分类(ZS-IC)上的表现,显示出英语 ImageNet 性能与高资源语言(如德语或中文)之间存在显著差距,而与低资源语言(如僧伽罗语或老挝语)的差距更大。关键的是,我们表明这些模型的 ZS-IC 性能与其在图文检索中的性能高度相关,从而验证了使用 Babel-ImageNet 在无黄金图文数据的情况下对绝大多数语言的多语言模型进行评测的合理性。最后,我们展示了通过参数高效的语言特定训练,可大幅提升多语言 CLIP 在低资源语言上的性能。我们公开了代码与数据:\url{https://github.com/gregor-ge/Babel-ImageNet}

关键词

引用

@article{arxiv.2306.08658,
  title  = {Babel-ImageNet: Massively Multilingual Evaluation of Vision-and-Language Representations},
  author = {Gregor Geigle and Radu Timofte and Goran Glavaš},
  journal= {arXiv preprint arXiv:2306.08658},
  year   = {2024}
}

备注

Accepted to ACL 2024