芬兰SQuAD: 基于DeepL的{span}注释机器翻译方法
计算与语言
2025-01-13 v1
摘要
我们应用一种简单方法来机器翻译带有span级别注释的数据集,利用DeepL MT服务及其能够翻译格式化文档的功能。通过该方法,我们产生了芬兰语版本的SQuAD2.0问答数据集,并在该新数据集上训练了QA检索模型。我们通过直接评估、与其他类似数据集的间接比较、反向翻译实验以及通过下游训练的QA模型性能来评估该数据集的质量以及更广泛地评估该MT方法。在所有这些评估中,我们发现该迁移方法不仅使用简单,而且产生了一致更好的翻译数据。鉴于其在SQuAD数据集上的良好性能,该方法很可能可用于翻译其他类似带span注释的数据集以适用于其他任务和语言。所有代码和数据均在开放许可下提供:数据在HuggingFace TurkuNLP/squad_v2_fi,代码在GitHub TurkuNLP/squad2-fi,模型在HuggingFace TurkuNLP/bert-base-finnish-cased-squad2。
引用
@article{arxiv.2501.05963,
title = {Finnish SQuAD: A Simple Approach to Machine Translation of Span Annotations},
author = {Emil Nuutinen and Iiro Rastas and Filip Ginter},
journal= {arXiv preprint arXiv:2501.05963},
year = {2025}
}
备注
NoDaLiDa 2025