迈向零样本跨语言图像检索
计算与语言
2020-12-10 v1 计算机视觉与模式识别
机器学习
摘要
近期多模态语言与视觉问题的研究兴趣激增。在语言侧,由于大多数多模态数据集为单语,这些模型主要关注英语。我们尝试通过文本侧跨语言预训练的零样本方法来弥补这一差距,以学习多模态表示。我们提出了一种简单而实用的构建跨语言图像检索模型的方法,该模型在单语训练集上训练,但可在推理时以零样本跨语言方式使用。我们还引入了一种新的目标函数,通过使不相似文本相互推远来收紧文本嵌入簇。最后,我们引入了一个在 7 种语言上收集的新的 1K 多语言 MSCOCO2014 描述测试数据集(XTD10),使用众包平台采集。我们将其用作评估跨语言零样本模型性能的测试集。XTD10 数据集在此公开:https://github.com/adobe-research/Cross-lingual-Test-Dataset-XTD10
引用
@article{arxiv.2012.05107,
title = {Towards Zero-shot Cross-lingual Image Retrieval},
author = {Pranav Aggarwal and Ajinkya Kale},
journal= {arXiv preprint arXiv:2012.05107},
year = {2020}
}