面向无资源语言的神经机器翻译:方法比较评估
计算与语言
2025-06-03 v2
摘要
无资源语言——即数字表征极其有限或缺失的语言——为机器翻译 (MT) 提出独特挑战。不同于低资源语言后者依赖有限但存在的语料,无资源语言往往仅能提供不足 100 句的训练数据。本文通过三种不同工作流程探索无资源翻译问题:翻译模型的微调、使用链式推理提示的大语言模型 (LLM) 零样本学习,以及无推理的直接提示。以 Owens Valley Paiute 作为案例研究,我们展示,无资源翻译需要与低资源场景截然不同的方法,因为传统机器翻译方法在低资源语言情境下便已失效。实证结果表明,尽管传统方法难以奏效,通用大语言模型的零样本学习能力却实现了无资源语言翻译,性能甚至超过低资源翻译方法,接近人类翻译水平 (BLEU 0.45-0.6);具体而言,链式推理提示在更大规模语料上表现更佳,而直接提示在小规模数据集上更具优势。由于这些方法具备语言无关性,可推广至广泛的无资源语言翻译任务,无需专家输入。本研究确立了无资源翻译为一个独立范式,表明其需要创新解决方案,为语言保存提供了实践与理论视角。
引用
@article{arxiv.2412.20584,
title = {Towards Neural No-Resource Language Translation: A Comparative Evaluation of Approaches},
author = {Madhavendra Thakur},
journal= {arXiv preprint arXiv:2412.20584},
year = {2025}
}
备注
Presented at the Columbia AI Summit 2025