中文

面向零样本跨语言图像检索与标注

机器学习 2021-09-17 v1

摘要

近期多模态语言与视觉问题的研究兴趣激增。在语言侧,这些模型大多聚焦于英语,因为多数多模态数据集是单语的。我们试图通过一种零样本方法弥合这一差距,该方法在文本侧使用跨语言预训练来学习多模态表示。我们提出了一种简单而实用的构建跨语言图像检索模型的方法,该模型在单语训练集上训练,但可在推理时以零样本跨语言方式使用。我们还引入了一个新的目标函数,通过将被不相似文本彼此推远来收紧文本嵌入簇。为评估,我们引入了一个在 7 种语言中收集的新的 1K 多语言 MSCOCO2014 caption 测试数据集(XTD10),使用众包平台采集。我们将其用作跨语言零样本模型性能的测试集。我们还展示了跨语言模型如何以零样本方式用于多语言图像标注等下游任务。XTD10 数据集在此公开提供:https://github.com/adobe-research/Cross-lingual-Test-Dataset-XTD10。

关键词

引用

@article{arxiv.2109.07622,
  title  = {Towards Zero-shot Cross-lingual Image Retrieval and Tagging},
  author = {Pranav Aggarwal and Ritiz Tambi and Ajinkya Kale},
  journal= {arXiv preprint arXiv:2109.07622},
  year   = {2021}
}

备注

Presented at Workshop on Multilingual Search, in conjunction with 30th The Web Conference 2021. arXiv admin note: substantial text overlap with arXiv:2012.05107