中文

记忆复活、持续学习及其超越:预训练编码器与解码器在多模态机器翻译中的评估

计算与语言 2025-04-28 v1 人工智能

摘要

多模态机器翻译(MMT)旨在通过利用图像等辅助模态来提高翻译质量。尽管大规模预训练语言和视觉模型在单模态自然语言处理任务中取得了显著进展,但其在MMT中的有效性和作用仍未得到充分探索。本文我们进行了一项系统性研究,考察预训练编码器和解码器在多模态翻译模型中的影响。具体而言,我们分析了不同训练策略——从从头训练到使用预训练和部分冻结组件——对统一MMT框架下翻译性能的影响。实验在Multi30K和CoMMuTE数据集上进行,涵盖英德和英法翻译任务。我们的结果揭示了在多模态环境中,预训练发挥了关键且非对称的作用:预训练解码器始终能够产生更流畅、更准确的输出,而预训练编码器的效果则取决于视觉文本对齐质量。此外,我们提供了模态融合与预训练组件之间相互作用的见解,为未来多模态翻译系统的架构设计提供指导。

关键词

引用

@article{arxiv.2504.18012,
  title  = {Memory Reviving, Continuing Learning and Beyond: Evaluation of Pre-trained Encoders and Decoders for Multimodal Machine Translation},
  author = {Zhuang Yu and Shiliang Sun and Jing Zhao and Tengfei Song and Hao Yang},
  journal= {arXiv preprint arXiv:2504.18012},
  year   = {2025}
}