UNISON:无配对跨语言图像描述生成
计算与语言
2022-02-08 v3
摘要
近年来,图像描述生成因其广泛的应用场景而成为有趣的研究领域。传统的图像描述生成范式依赖于配对的图像-描述数据集以监督方式训练模型。然而,为每种目标语言创建此类配对数据集成本极高,这阻碍了描述生成技术的可扩展性,并使世界上很大一部分人口无法从中受益。在本工作中,我们提出了一种新颖的无配对跨语言方法,在不依赖源语言或目标语言中任何描述语料的情况下生成图像描述。具体而言,我们的方法包括两个阶段:(i)跨语言自编码过程,利用句子平行(双语)语料学习从源语言到目标语言在场景图编码空间中的映射,并解码出目标语言句子;(ii)跨模态无监督特征映射,旨在将编码后的场景图特征从图像模态映射到语言模态。我们在中文图像描述生成任务上验证了所提方法的有效性。与几种现有方法的比较证明了我们方法的有效性。
引用
@article{arxiv.2010.01288,
title = {UNISON: Unpaired Cross-lingual Image Captioning},
author = {Jiahui Gao and Yi Zhou and Philip L. H. Yu and Shafiq Joty and Jiuxiang Gu},
journal= {arXiv preprint arXiv:2010.01288},
year = {2022}
}
备注
Accepted by AAAI-2022