Tradutor:构建特定方言的翻译模型
计算与语言
2025-02-21 v1
摘要
语言模型已成为许多广泛使用系统的基础,但这些看似有利的模型也是双刃剑。虽然它们在涉及资源丰富语言(如英语)的任务中表现出色,但往往无法捕捉语言形式、方言和地区变体所固有的细微差别。诸如欧洲葡萄牙语此类语言因被更受欢迎的巴西葡萄牙语所忽视,导致在各种语言任务中性能不佳。为解决这一差距,我们介绍了首个专为欧洲葡萄牙语设计的开源翻译模型,同时构建了一个专为此任务设计的新型数据集。通过在两个基准数据集上的自动评估,我们的最佳模型在葡萄牙语翻译任务中超越了现有开源翻译系统,并接近行业领先的闭源系统在欧洲葡萄牙语的性能。通过公开数据集、模型和代码,我们旨在支持并鼓励进一步的研究,推动对被边缘化语言变体表征的发展。
引用
@article{arxiv.2502.14385,
title = {Tradutor: Building a Variety Specific Translation Model},
author = {Hugo Sousa and Satya Almasian and Ricardo Campos and Alípio Jorge},
journal= {arXiv preprint arXiv:2502.14385},
year = {2025}
}
备注
AAAI 2025