用于视觉-语言模型零样本跨语言迁移的多语言多模态预训练
计算机视觉与模式识别
2021-04-16 v3 计算与语言
摘要
本文研究视觉-语言模型的零样本跨语言迁移。具体而言,我们关注多语言文本到视频检索,并提出一种基于 Transformer 的模型,该模型学习上下文化的多语言多模态嵌入。在零样本设定下,我们经实证表明,当我们用非英语句子查询多语言文本-视频模型时,性能显著下降。为解决此问题,我们引入了一种多语言多模态预训练策略,并收集了一个新的多语言教学视频数据集(MultiHowTo100M)用于预训练。在 VTT 上的实验表明,我们的方法显著改善了非英语语言的视频检索,且无需额外标注。此外,当有多语言标注可用时,我们的方法在 VTT 和 VATEX 上的多语言文本到视频检索,以及在 Multi30K 上的多语言文本到图像检索中,大幅优于近期基线方法;我们的模型和 Multi-HowTo100M 可在 http://github.com/berniebear/Multi-HT100M 获取。
引用
@article{arxiv.2103.08849,
title = {Multilingual Multimodal Pre-training for Zero-Shot Cross-Lingual Transfer of Vision-Language Models},
author = {Po-Yao Huang and Mandela Patrick and Junjie Hu and Graham Neubig and Florian Metze and Alexander Hauptmann},
journal= {arXiv preprint arXiv:2103.08849},
year = {2021}
}
备注
accepted by NAACL 2021