基于 Transformer 的低资源语言翻译流水线比较
计算与语言
2025-09-17 v1 计算工程、金融与科学
计算机与社会
机器学习
摘要
本工作比较了三种用于训练基于 Transformer 的神经网络的流水线,以生成班巴拉语(一种在非洲约有 14,188,850 人使用的 Mandè 语)的机器翻译器。第一条流水线训练一个简单的 Transformer 将法语句子翻译成班巴拉语。第二条流水线使用 decoder-only 架构微调 LLaMA3 (3B-8B) 指令模型,进行法语到班巴拉语的翻译。前两条流水线的模型采用不同的超参数组合进行训练,以提高 BLEU 和 chrF 得分,并在测试句子和官方班巴拉语基准上进行评估。第三条流水线使用师生双神经网络的 language distillation,将班巴拉语整合到预训练的 LaBSE 模型中,该模型提供与语言无关的嵌入。然后将 BERT 扩展应用于 LaBSE 以生成翻译。所有流水线均在 Dokotoro(医学领域)和 Bayelemagaba(混合领域)上进行了测试。结果表明,第一条流水线虽然更简单,但实现了最佳翻译准确率(在 Bayelemagaba 上为 10% BLEU,21% chrF),这与低资源翻译结果一致。在为本研究创建的 Yiri 数据集上,它达到了 33.81% 的 BLEU 和 41% 的 chrF。基于指令的模型在单一数据集上的表现优于在聚合集合上的表现,表明它们能更有效地捕获特定于数据集的模式。
引用
@article{arxiv.2509.12514,
title = {A comparison of pipelines for the translation of a low resource language based on transformers},
author = {Chiara Bonfanti and Michele Colombino and Giulia Coucourde and Faeze Memari and Stefano Pinardi and Rosa Meo},
journal= {arXiv preprint arXiv:2509.12514},
year = {2025}
}
备注
9 pages, 4 figures