中文

Translatotron-V(ision):一种用于图内机器翻译的端到端模型

计算与语言 2024-07-04 v1 人工智能

摘要

图内机器翻译(IIMT)旨在将包含源语言文本的图像翻译为包含目标语言译文的图像。在这方面,传统的级联方法存在诸多问题,如错误传播、参数量庞大,以及在部署和保留输入图像视觉特征方面的困难。因此,构建端到端模型成为一种选择,然而这面临两个主要挑战:1)巨大的建模负担,因为需要同时学习跨语言对齐并保留输入图像的视觉特征;2)直接预测过长像素序列的困难。在本文中,我们提出了\textit{Translatotron-V(ision)},一个由四个模块组成的端到端IIMT模型。除了图像编码器和图像解码器外,我们的模型还包含一个目标文本解码器和一个图像分词器。其中,目标文本解码器用于缓解语言对齐负担,图像分词器将长像素序列转换为更短的视觉令牌序列,防止模型聚焦于低级视觉特征。此外,我们为模型提出了一个两阶段训练框架,以辅助模型学习跨模态和跨语言的对齐。最后,我们提出了一种名为Structure-BLEU的位置感知评估指标,用于评估生成图像的翻译质量。实验结果表明,我们的模型仅使用70.9\%的参数就实现了与级联模型相当的性能,并显著优于像素级端到端IIMT模型。

关键词

引用

@article{arxiv.2407.02894,
  title  = {Translatotron-V(ison): An End-to-End Model for In-Image Machine Translation},
  author = {Zhibin Lan and Liqiang Niu and Fandong Meng and Jie Zhou and Min Zhang and Jinsong Su},
  journal= {arXiv preprint arXiv:2407.02894},
  year   = {2024}
}

备注

Accepted to ACL 2024 Findings