视频中的视觉 grounding 用于无监督词翻译
计算机视觉与模式识别
2020-03-27 v2 计算与语言
机器学习
摘要
地球上有数千种活跃使用的语言,但只有一个视觉世界。基于此视觉世界的 grounding 有潜力弥合所有这些语言之间的鸿沟。我们的目标是通过视觉 grounding 改进语言间的无监督词映射。核心思想是通过从以母语旁白的未配对教学视频中学习嵌入,在两门语言间建立共同的视觉表征。给定该共享嵌入,我们证明:(i)我们可以映射语言间的词,尤其是“视觉”词;(ii)该共享嵌入为现有无监督基于文本的词的翻译技术提供了良好的初始化,构成了我们提出的混合视觉-文本映射算法 MUVE 的基础;以及(iii)我们的方法通过解决基于文本方法的缺陷实现了更优性能——它更鲁棒、能处理共性较少的数据集,并适用于低资源语言。我们将这些方法应用于从英语到法语、韩语和日语的词翻译——全部无需任何平行语料库,仅通过观看人们边做边说的许多视频实现。
引用
@article{arxiv.2003.05078,
title = {Visual Grounding in Video for Unsupervised Word Translation},
author = {Gunnar A. Sigurdsson and Jean-Baptiste Alayrac and Aida Nematzadeh and Lucas Smaira and Mateusz Malinowski and João Carreira and Phil Blunsom and Andrew Zisserman},
journal= {arXiv preprint arXiv:2003.05078},
year = {2020}
}
备注
CVPR 2020