利用多模态码本探索更优的文本图像翻译
计算与语言
2023-06-05 v2 人工智能
摘要
文本图像翻译(TIT)旨在将图像中嵌入的源文本翻译为目标译文,具有广泛应用因而具有重要研究价值。然而,当前 TIT 研究面临两个主要瓶颈:1)该任务缺乏公开可用的 TIT 数据集;2)主导模型以级联方式构建,易遭受光学字符识别(OCR)的错误传播。本工作中,我们首先标注了一个名为 OCRMT30K 的中英 TIT 数据集,为后续研究提供便利。随后,我们提出一种带多模态码本的 TIT 模型,其能够将图像与相关文本关联,为翻译提供有用的补充信息。此外,我们提出一个涉及文本机器翻译、图像-文本对齐及 TIT 任务的多阶段训练框架,充分挖掘额外的双语文本、OCR 数据集及我们的 OCRMT30K 数据集来训练模型。大量实验与深入分析有力证明了我们所提模型及训练框架的有效性。
引用
@article{arxiv.2305.17415,
title = {Exploring Better Text Image Translation with Multimodal Codebook},
author = {Zhibin Lan and Jiawei Yu and Xiang Li and Wen Zhang and Jian Luan and Bin Wang and Degen Huang and Jinsong Su},
journal= {arXiv preprint arXiv:2305.17415},
year = {2023}
}
备注
Accepted by ACL 2023 Main Conference