错误分析提示使大型语言模型实现类人的翻译评估
计算与语言
2024-06-06 v4
摘要
生成式大型语言模型(LLM),如ChatGPT,已在机器翻译、文本摘要等多个NLP任务中展现出卓越能力。近期研究(Kocmi和Federmann,2023)表明,利用LLM评估机器翻译(MT)质量在系统层面达到了最先进性能,但在句段层面表现较差。为了进一步提升LLM在MT质量评估上的表现,我们研究了若干提示设计,并提出一种称为错误分析提示(EAPrompt)的新提示方法,其结合了思维链(Wei等,2022)与错误分析(Lu等,2023)。该技术模拟了被广泛接受的人类评估框架——多维质量度量(MQM,Freitag等(2021)),并在系统层面和句段层面均产生可解释且可靠的MT评估。来自WMT22指标共享任务的实验结果验证了EAPrompt在不同结构多种LLM上的有效性。进一步分析确认,EAPrompt能有效区分主要错误与次要错误,同时其错误数量分布与MQM相似。这些发现凸显了EAPrompt作为类人评估提示技术用于MT评估的潜力。
引用
@article{arxiv.2303.13809,
title = {Error Analysis Prompting Enables Human-Like Translation Evaluation in Large Language Models},
author = {Qingyu Lu and Baopu Qiu and Liang Ding and Kanjian Zhang and Tom Kocmi and Dacheng Tao},
journal= {arXiv preprint arXiv:2303.13809},
year = {2024}
}
备注
Findings of ACL 2024