为纯文本翻译模型添加多模态能力
计算与语言
2024-03-06 v1
摘要
虽然当前大多数多模态机器翻译 (MMT) 工作使用 Multi30k 数据集进行训练和评估,但我们发现由此产生的模型在极大程度上过拟合了 Multi30k 数据集。因此,这些模型在针对典型的纯文本测试集(如 WMT newstest 数据集)进行评估时表现非常差。为了在 Multi30k 和典型纯文本数据集上均表现良好,我们使用高性能的纯文本机器翻译 (MT) 模型作为 MMT 模型的起点。我们在 MT 模型中添加了通过门控机制连接的视觉 - 文本适配器层,并通过 1) 使用基于视觉的源文本掩码进行预训练,以及 2) 在 Multi30k 上进行微调,逐步将 MT 模型转化为 MMT 模型。
引用
@article{arxiv.2403.03045,
title = {Adding Multimodal Capabilities to a Text-only Translation Model},
author = {Vipin Vijayan and Braeden Bowen and Scott Grigsby and Timothy Anderson and Jeremy Gwinnup},
journal= {arXiv preprint arXiv:2403.03045},
year = {2024}
}