基于跨模态跨语言预训练的面向产品机器翻译
计算机视觉与模式识别
2021-08-26 v1
摘要
翻译电子商务产品描述,即面向产品机器翻译 (Product-oriented Machine Translation, PMT),对于服务全球电子商务购物者至关重要。然而,由于领域特殊性,PMT 任务比传统机器翻译问题更具挑战性。首先,产品描述中有许多专业术语,在没有产品图像的情况下翻译存在歧义。其次,产品描述与图像的关联方式比标准图像描述更复杂,涉及对象、形状、颜色甚至主观风格等各种视觉方面。此外,现有的 PMT 数据集规模较小,难以支持相关研究。本文首先构建了一个名为 Fashion-MMT 的大规模双语产品描述数据集,其中包含超过 11.4 万条带噪翻译和 4 万条人工清洗的描述翻译,并附带多张产品图像。为了在翻译中有效学习产品图像与双语文本之间的语义对齐,我们设计了一个统一的面向产品跨模态跨语言模型 (\upoc~) 用于预训练和微调。在 Fashion-MMT 和 Multi30k 数据集上的实验表明,即使在相同数据集上进行预训练,我们的模型也显著优于 state-of-the-art 模型。结果还表明,该模型能从大规模带噪数据中获益更多,以提升翻译质量。我们将在 https://github.com/syuqings/Fashion-MMT 发布数据集和代码。
引用
@article{arxiv.2108.11119,
title = {Product-oriented Machine Translation with Cross-modal Cross-lingual Pre-training},
author = {Yuqing Song and Shizhe Chen and Qin Jin and Wei Luo and Jun Xie and Fei Huang},
journal= {arXiv preprint arXiv:2108.11119},
year = {2021}
}
备注
Accepted as Oral by ACMMM 2021