MTUncertainty:通过微调 OpenAI LLM 评估机器翻译输出是否需要译后编辑
计算与语言
2024-06-24 v6 人工智能
摘要
翻译质量评估(TQE)是现代翻译生产流程中必不可少的一步。TQE 在无需参考译文的情况下评估机器翻译(MT)与人工翻译(HT)质量方面至关重要。自动评估甚至仅估算翻译质量的能力,可通过流程优化带来显著的效率提升。本工作考察最先进的大语言模型(LLM)是否可用于此目的。我们采用 OpenAI 模型作为最佳前沿技术,并将 TQE 视为二分类任务。在包含英意、英德、英法、英日、英荷、英葡、英土和英中八个语言对的实验中,我们的结果表明微调后的 gpt3.5 在翻译质量预测任务(即翻译是否需要编辑)上可展现出良好性能。另一发现是,通过比较 OpenAI 三个不同版本模型——curie、davinci 和 gpt3.5(参数分别为 13B、175B 和 175B)——的性能可知,单纯增大 LLM 规模并未在此任务上带来明显更优的表现。
引用
@article{arxiv.2308.00158,
title = {MTUncertainty: Assessing the Need for Post-editing of Machine Translation Outputs by Fine-tuning OpenAI LLMs},
author = {Serge Gladkoff and Lifeng Han and Gleb Erofeev and Irina Sorokina and Goran Nenadic},
journal= {arXiv preprint arXiv:2308.00158},
year = {2024}
}
备注
Accepted by EAMT2024: The 25th Annual Conference of The European Association for Machine Translation