ViTA:通过对齐对象标签的视觉-语言翻译
计算与语言
2021-06-29 v3 计算机视觉与模式识别
摘要
多模态机器翻译(MMT)利用视觉信息丰富源文本以进行翻译。近年来它日益受到关注,并且已有若干沿同一方向提出的流程。然而,该任务缺乏高质量数据集来阐明视觉模态在翻译系统中的贡献。本文以 Volta 团队名义提出我们参与 WAT 2021 英译印地语多模态翻译任务的系统。我们也参与了同一语言对的纯文本子任务,为此我们使用了预训练多语言序列到序列模型 mBART。对于多模态翻译,我们提出通过从图像中提取对象标签将视觉信息带入文本域,从而增强文本输入。我们还通过系统性地退化源文本来探索系统的鲁棒性。最终,我们在多模态任务的测试集与挑战集上分别取得了 44.6 和 51.6 的 BLEU 分数。
引用
@article{arxiv.2106.00250,
title = {ViTA: Visual-Linguistic Translation by Aligning Object Tags},
author = {Kshitij Gupta and Devansh Gautam and Radhika Mamidi},
journal= {arXiv preprint arXiv:2106.00250},
year = {2021}
}
备注
7 pages, accepted at WAT-2021 co-located with ACL-IJCNLP 2021