中文

MultiScript30k:利用多语言嵌入扩展跨脚本平行数据

计算与语言 2025-12-15 v1 人工智能 机器学习 多媒体

摘要

Multi30k在多模态机器翻译(MMT)文献中被频繁引用,为训练和微调深度学习模型提供平行文本数据。然而,它仅限于四种语言:捷克语、英语、法语和德语。这一限制导致许多研究者仅关注这些语言。因此,由于官方Multi30k数据集仅代表拉丁脚本的欧洲语言,多样化语言的MMT研究陷入停滞。现有的Multi30k扩展工作存在,但支持的语言列表、代表的语系和脚本仍然很短。为解决这些问题,我们提出了MultiScript30k,一个面向全球各种脚本语言的新Multi30k数据集扩展,通过使用NLLB200-3.3B翻译Multi30k的英文版(Multi30k-En)创建。该数据集包含超过30000个句子,提供Multi30k-En中所有句子到Ar、Es、Uk、Zh_Hans和Zh_Hant的翻译。相似性分析显示,Multi30k扩展对所有支持语言(除Zh_Hant外)一致实现了大于0.8的余弦相似度和小于0.000251的对称KL散度,Zh_Hant的表现与之前的Multi30k扩展ArEnMulti30k和Multi30k-Uk相当。COMETKiwi评分揭示了MultiScript30k作为Multi30k-En翻译的混合评估结果。ArEnMulti30k的评分几乎等于MultiScript30k-Ar,但Multi30k-Uk的评分每折比MultiScript30k-Uk高6.4%。

关键词

引用

@article{arxiv.2512.11074,
  title  = {MultiScript30k: Leveraging Multilingual Embeddings to Extend Cross Script Parallel Data},
  author = {Christopher Driggers-Ellis and Detravious Brinkley and Ray Chen and Aashish Dhawan and Daisy Zhe Wang and Christan Grant},
  journal= {arXiv preprint arXiv:2512.11074},
  year   = {2025}
}

备注

7 pages, 2 figures, 5 tables. Not published at any conference at this time