基于自监督奖励的跨语言无配对图像描述生成
计算机视觉与模式识别
2019-08-16 v1 计算与语言
摘要
生成不同语言的图像描述对于满足全球用户至关重要。然而,为每种目标语言收集大规模配对图像-描述数据集以训练良好的图像描述模型是极其昂贵的。先前的工作通过枢纽语言解决无配对跨语言图像描述问题,即借助枢纽语言的配对图像-描述数据以及枢纽语言到目标语言的机器翻译模型。然而,这种语言枢纽方法受到枢纽到目标翻译所带来的不准确性的影响,包括不流畅和视觉无关错误。在本文中,我们提出在强化学习框架中利用自监督奖励生成跨语言图像描述,以缓解这两类错误。我们采用目标语言中单语语料的自监督来提供流畅性奖励,并提出一个多级视觉语义匹配模型来提供句子级和概念级的视觉相关性奖励。我们在两个广泛使用的图像描述语料库上分别进行了英文和中文的无配对跨语言图像描述大量实验。所提方法相比最先进的方法取得了显著的性能提升。
引用
@article{arxiv.1908.05407,
title = {Unpaired Cross-lingual Image Caption Generation with Self-Supervised Rewards},
author = {Yuqing Song and Shizhe Chen and Yida Zhao and Qin Jin},
journal= {arXiv preprint arXiv:1908.05407},
year = {2019}
}
备注
Accepted by ACMMM 2019