ChatGPT 机器翻译:在高资源语言上具竞争力(但在低资源语言上不然)
计算与语言
2023-09-15 v1
摘要
大语言模型(LLMs)隐式地学习执行一系列语言任务,包括机器翻译(MT)。已有研究探讨了 LLM 的 MT 能力的若干方面。然而,存在大量语言,其近期 LLM 的 MT 性能此前从未被评估过。在没有相关已发表实验证据的情况下,世界各地多样语言的使用者难以知晓他们能否以及如何为其语言使用 LLM。我们利用 FLORES-200 基准,首次针对多达 204 种语言给出了实验证据,并附带 MT 成本分析。趋势表明,GPT 模型在某些高资源语言(HRLs)上接近或超越传统 MT 模型性能,但在低资源语言(LRLs)上始终落后,在我们覆盖的语言中有 84.1% 的语言其表现不及传统 MT。我们的分析揭示,语言资源水平是决定 ChatGPT 相对翻译能力的最重要的特征,并表明 ChatGPT 在 LRLs 和非洲语言上尤其处于劣势。
引用
@article{arxiv.2309.07423,
title = {ChatGPT MT: Competitive for High- (but not Low-) Resource Languages},
author = {Nathaniel R. Robinson and Perez Ogayo and David R. Mortensen and Graham Neubig},
journal= {arXiv preprint arXiv:2309.07423},
year = {2023}
}
备注
27 pages, 9 figures, 14 tables