中文

细节在于错误:利用大语言模型进行细粒度机器翻译评估

计算与语言 2023-08-15 v1 机器学习

摘要

机器翻译(MT)的自动评估是推动 MT 系统快速迭代开发的关键工具。尽管在估计单一标量质量分数方面已取得可观进展,当前指标缺乏标注个体错误(如多维质量指标(MQM))的更详细方案所具有的信息量。本文提出 AutoMQM 这一提示技术以填补此空白,其利用大语言模型(LLM)的推理与上下文学习能力,令其识别并分类翻译中的错误。我们首先通过简单的分数预测提示评估 PaLM 与 PaLM-2 等近期 LLM,并研究标注数据在上下文学习与微调中的影响。随后用 PaLM-2 模型评估 AutoMQM,发现相较于仅提示预测分数,其性能更优(较大模型增益尤为显著),且通过与人标注一致的错误跨度提供可解释性。

关键词

引用

@article{arxiv.2308.07286,
  title  = {The Devil is in the Errors: Leveraging Large Language Models for Fine-grained Machine Translation Evaluation},
  author = {Patrick Fernandes and Daniel Deutsch and Mara Finkelstein and Parker Riley and André F. T. Martins and Graham Neubig and Ankush Garg and Jonathan H. Clark and Markus Freitag and Orhan Firat},
  journal= {arXiv preprint arXiv:2308.07286},
  year   = {2023}
}

备注

19 pages