中文

DeepL与Supertext翻译性能比较

计算与语言 2025-05-21 v3

摘要

随着基于大型语言模型(LLM)的机器翻译(MT)系统日益增长,可靠的质量基准测试需要能够捕捉其利用扩展上下文能力的方法。本研究通过评估其在无段落文本上的翻译性能来比较两种商业MT系统——DeepL和Supertext。我们在四个语言方向上评估翻译质量,由专业翻译者在完整文档级别的上下文中评估各段。虽然段落级别的评估表明大多数情况下两种系统没有明显偏好,但文档级别的分析显示在三个语言方向上对Supertext的偏好,表明其在较长文本上的一致性更佳。我们主张采用更加注重上下文的评估方法,以确保MT质量评估反映实际可用性。我们在https://github.com/supertext/evaluation_deepl_supertext发布了所有评估数据和脚本,以便进一步分析和复现。

关键词

引用

@article{arxiv.2502.02577,
  title  = {A comparison of translation performance between DeepL and Supertext},
  author = {Alex Flückiger and Chantal Amrhein and Tim Graf and Frédéric Odermatt and Martin Pömsl and Philippe Schläpfer and Florian Schottmann and Samuel Läubli},
  journal= {arXiv preprint arXiv:2502.02577},
  year   = {2025}
}

备注

Paper accepted at MT Summit 2025