ConECT 数据集:消解电商机器翻译数据稀缺问题
计算与语言
2025-06-10 v2
摘要
神经机器翻译 (NMT) 通过基于Transformer的模型提高了翻译质量,但仍在处理词义歧义和上下文方面存在挑战。这一问题在特定领域应用中尤为突出,常表现为句子模糊或数据质量差。我们的研究探索了如何向模型添加信息以提高电商数据上下文翻译的质量。为此,我们创建了ConECT——一个新的由11,400句中文本到波兄语电商产品翻译数据集,包含图像和由产品元数据构成的上下文信息。我们随后检验并比较了适用于上下文感知翻译的不同方法。我们测试了视觉语言模型 (VLM),发现视觉上下文有助于提升翻译质量。此外,我们探索了将上下文信息融入文本到文本模型中的方法,如产品的类别路径或图像描述。本研究结果表明,融合上下文信息可显著提升机器翻译质量。我们将公开此新数据集。
引用
@article{arxiv.2506.04929,
title = {ConECT Dataset: Overcoming Data Scarcity in Context-Aware E-Commerce MT},
author = {Mikołaj Pokrywka and Wojciech Kusa and Mieszko Rutkowski and Mikołaj Koszowski},
journal= {arXiv preprint arXiv:2506.04929},
year = {2025}
}
备注
Accepted at ACL 2025 (The 63rd Annual Meeting of the Association for Computational Linguistics)