中文

为纯文本翻译模型添加多模态能力

计算与语言 2024-03-06 v1

摘要

虽然当前大多数多模态机器翻译 (MMT) 工作使用 Multi30k 数据集进行训练和评估,但我们发现由此产生的模型在极大程度上过拟合了 Multi30k 数据集。因此,这些模型在针对典型的纯文本测试集(如 WMT newstest 数据集)进行评估时表现非常差。为了在 Multi30k 和典型纯文本数据集上均表现良好,我们使用高性能的纯文本机器翻译 (MT) 模型作为 MMT 模型的起点。我们在 MT 模型中添加了通过门控机制连接的视觉 - 文本适配器层,并通过 1) 使用基于视觉的源文本掩码进行预训练,以及 2) 在 Multi30k 上进行微调,逐步将 MT 模型转化为 MMT 模型。

关键词

引用

@article{arxiv.2403.03045,
  title  = {Adding Multimodal Capabilities to a Text-only Translation Model},
  author = {Vipin Vijayan and Braeden Bowen and Scott Grigsby and Timothy Anderson and Jeremy Gwinnup},
  journal= {arXiv preprint arXiv:2403.03045},
  year   = {2024}
}