迈向全自动漫画翻译
计算与语言
2021-01-12 v3
摘要
我们着手解决日本漫画的机器翻译问题。漫画翻译涉及机器翻译中的两个重要问题:上下文感知翻译和多模态翻译。由于漫画中文本和图像以非结构化的方式混合,从图像中获取上下文对于漫画翻译至关重要。然而,如何从图像中提取上下文并整合到机器翻译(MT)模型中仍然是一个开放问题。此外,目前尚无用于训练和评估此类模型的语料库和基准。在本文中,我们做出了以下四项贡献,奠定了漫画翻译研究的基础。首先,我们提出了多模态上下文感知翻译框架。我们是首个将来自漫画图像的上下文信息结合进来的。它使我们能够翻译那些不使用上下文信息(例如其他文本气泡中的文本、说话者的性别等)就无法翻译的文本气泡中的文本。其次,为了训练模型,我们提出了一种从原始漫画及其翻译对中自动构建语料库的方法,借此无需任何人工标注即可构建大规模平行语料库。第三,我们创建了一个用于评估漫画翻译的新基准。最后,在我们提出的方法之上,我们设计了一个首个用于全自动漫画翻译的综合系统。
引用
@article{arxiv.2012.14271,
title = {Towards Fully Automated Manga Translation},
author = {Ryota Hinami and Shonosuke Ishiwatari and Kazuhiko Yasuda and Yusuke Matsui},
journal= {arXiv preprint arXiv:2012.14271},
year = {2021}
}
备注
Accepted to AAAI 2021