大语言模型是翻译质量评估的当前最优评估器
计算与语言
2023-06-02 v2
摘要
我们描述了GEMBA,一种基于GPT的翻译质量评估度量,它既可与参考译文配合使用,也可独立使用。在我们的评估中,我们聚焦于零样本提示,根据参考译文是否可用,在两种模式下比较四种提示变体。我们研究了九个版本的GPT模型,包括ChatGPT和GPT-4。我们表明,我们的翻译质量评估方法仅在使用GPT~3.5及更大模型时有效。与WMT22 Metrics共享任务的结果相比,当对照基于MQM的人工标注时,我们的方法在两种模式下均达到了当前最优准确率。我们的结果在系统层面对所有三个WMT22 Metrics共享任务语言对均有效,即英语到德语、英语到俄语以及汉语到英语。这首次揭示了预训练生成式大语言模型在翻译质量评估中的有用性。我们公开释出了本工作所描述实验使用的所有代码和提示模板,以及所有相应的评分结果,以便外部验证和复现。
引用
@article{arxiv.2302.14520,
title = {Large Language Models Are State-of-the-Art Evaluators of Translation Quality},
author = {Tom Kocmi and Christian Federmann},
journal= {arXiv preprint arXiv:2302.14520},
year = {2023}
}
备注
Accepted in EAMT, 10 pages, 8 tables, one figure