中文

探究超低资源语言微调翻译器的性能差异:语言差异是否重要?

计算与语言 2025-12-01 v1 人工智能

摘要

使用小量数据对预训练语言模型进行微调是创建针对极低资源语言(如濒卫土著语言)翻译器的常用方法。然而,先前的研究报告了使用相似方法和数据的翻译器之间存在显著不同的性能。在本工作中,我们系统性地探讨了可能导致性能差异的原因,旨在确定其是源于不同的清洗程序、预训练模型的局限性、基础模型的大小,还是训练数据集的大小,研究了两种语言的双向翻译。在我们的研究中,使用两种巴西土著语言进行,二者虽相关但具有显著的结构性语言特征,结果表明这些训练因素对性能影响有限,暗示语言之间的差异可能在微调预训练模型以产生翻译器方面发挥重要作用。

关键词

引用

@article{arxiv.2511.22482,
  title  = {Exploring Performance Variations in Finetuned Translators of Ultra-Low Resource Languages: Do Linguistic Differences Matter?},
  author = {Isabel Gonçalves and Paulo Cavalin and Claudio Pinhanez},
  journal= {arXiv preprint arXiv:2511.22482},
  year   = {2025}
}