GPT 模型在机器翻译中的表现如何?一项全面评估
计算与语言
2023-02-21 v1
摘要
生成式预训练 Transformer(GPT)模型在自然语言生成方面展现出卓越的能力,但其在机器翻译中的性能尚未得到深入探究。本文对 GPT 模型在机器翻译中的表现进行了全面评估,涵盖多个方面,例如不同 GPT 模型与最先进的研究和商业系统相比的翻译质量、提示策略的效果、对领域迁移的鲁棒性以及文档级翻译。我们实验了十八种不同的翻译方向,涉及高资源与低资源语言以及非英语中心的翻译,并评估了三种 GPT 模型:ChatGPT、GPT3.5(text-davinci-003)和 text-davinci-002。结果表明,GPT 模型在高资源语言上取得了极具竞争力的翻译质量,但在低资源语言上能力有限。我们还表明,将 GPT 模型与其他翻译系统相结合的混合方法可以进一步提升翻译质量。我们进行了全面的分析和人工评估,以进一步理解 GPT 翻译的特性。希望本文能为该领域的研究者和实践者提供有价值的见解,并有助于更好地理解 GPT 模型在翻译方面的潜力与局限。
引用
@article{arxiv.2302.09210,
title = {How Good Are GPT Models at Machine Translation? A Comprehensive Evaluation},
author = {Amr Hendy and Mohamed Abdelrehim and Amr Sharaf and Vikas Raunak and Mohamed Gabr and Hitokazu Matsushita and Young Jin Kim and Mohamed Afify and Hany Hassan Awadalla},
journal= {arXiv preprint arXiv:2302.09210},
year = {2023}
}