弥合合成图像与真实图像在多模态机器翻译中的鸿沟
计算机视觉与模式识别
2023-10-23 v1 人工智能
计算与语言
摘要
多模态机器翻译(MMT)同时以源语句和一幅相关图像作为输入进行翻译。由于在多数情况下输入语句没有配对的可用图像,近期研究建议使用强大的文本到图像生成模型来提供图像输入。然而,这些模型生成的合成图像通常与真实图像遵循不同的分布。因此,使用真实图像训练而使用合成图像推理会引入分布偏移,导致推理时性能下降。为应对这一挑战,本文分别将合成图像与真实图像输入MMT模型。随后我们通过拉近Transformer编码器输入图像表示与Transformer解码器输出分布来最小化合成与真实图像间的鸿沟。从而我们缓解了推理时合成图像引入的分布差异,使推理过程摆脱对真实图像的依赖。实验结果表明,我们的方法在Multi30K En-De和En-Fr数据集上取得了最先进的性能,且在推理时独立于真实图像。
引用
@article{arxiv.2310.13361,
title = {Bridging the Gap between Synthetic and Authentic Images for Multimodal Machine Translation},
author = {Wenyu Guo and Qingkai Fang and Dong Yu and Yang Feng},
journal= {arXiv preprint arXiv:2310.13361},
year = {2023}
}
备注
Accepted to EMNLP 2023 main conference