从信息论视角提升多模态神经机器翻译的视觉感知
计算机视觉与模式识别
2022-10-18 v1 计算与语言
摘要
多模态机器翻译(MMT)旨在通过为源句子配备对应图像来提升翻译质量。尽管性能可观,MMT 模型仍受输入退化问题困扰:模型更关注文本信息,而视觉信息通常被忽视。本文中,我们致力于从信息论视角提升视觉感知以改进 MMT 性能。具体而言,我们将信息性视觉信号分解为两部分:源特定信息与目标特定信息。我们利用互信息对二者进行量化,并提出两种目标优化方法以更好地利用视觉信号。在两份数据集上的实验表明,我们的方法能有效增强 MMT 模型的视觉感知,并取得优于强基线的结果。
引用
@article{arxiv.2210.08478,
title = {Increasing Visual Awareness in Multimodal Neural Machine Translation from an Information Theoretic Perspective},
author = {Baijun Ji and Tong Zhang and Yicheng Zou and Bojie Hu and Si Shen},
journal= {arXiv preprint arXiv:2210.08478},
year = {2022}
}
备注
10 pages, 4 figures; EMNLP main conference