中文

迷失于源语言:大型语言模型如何评估机器翻译质量

计算与语言 2024-06-07 v2 人工智能

摘要

本研究探讨了大型语言模型(LLMs)在机器翻译评估任务中如何利用源语言和参考译文数据,旨在更好地理解其在该任务中卓越表现背后的机制。我们设计了跨不同输入模式和模型类型的受控实验,并采用粗粒度和细粒度提示来辨别源语言信息与参考信息的效用。我们发现,参考信息显著提高了评估准确性,而令人惊讶的是,源语言信息有时反而适得其反,这表明LLMs在评估翻译时无法充分利用其跨语言能力。对细粒度评估和微调实验的进一步分析显示了类似的结果。这些发现也为LLMs指明了一个潜在的研究方向,即充分利用LLMs的跨语言能力,以在机器翻译评估任务中取得更优性能。

关键词

引用

@article{arxiv.2401.06568,
  title  = {Lost in the Source Language: How Large Language Models Evaluate the Quality of Machine Translation},
  author = {Xu Huang and Zhirui Zhang and Xiang Geng and Yichao Du and Jiajun Chen and Shujian Huang},
  journal= {arXiv preprint arXiv:2401.06568},
  year   = {2024}
}

备注

Accepted by ACL2024 Findings