机器翻译评估是否实现了人类水平?谈论人类参考标准与进步的界限
计算与语言
2025-06-25 v1 人工智能
摘要
在机器翻译 (MT) 评估中,指标性能基于与人类判断的一致性进行评估。近年来,自动评估指标已展现出越来越高的与人类的一致性水平。为更清晰地理解指标性能并建立上限,我们在 MT 元评估中纳入了人类基准,即评估 MT 评估指标能力的衡量标准。我们的结果表明,人类注释员在一致性方面并不优于自动评估指标,-state-of-the-art 指标常常在与人类基准的比较中与之持平或更好。尽管这些发现暗示实现了人类水平,但我们仍讨论了若干谨慎理由。最后,我们探讨了这些结果对整个研究领域的更广泛影响,提出:我们还能可靠地衡量 MT 评估中的改进吗?本工作旨在为该领域的进步测量能力设定界限,促进对我们认为关乎整个 MT 评估社区的关键议题的讨论。
引用
@article{arxiv.2506.19571,
title = {Has Machine Translation Evaluation Achieved Human Parity? The Human Reference and the Limits of Progress},
author = {Lorenzo Proietti and Stefano Perrella and Roberto Navigli},
journal= {arXiv preprint arXiv:2506.19571},
year = {2025}
}
备注
Accepted at ACL 2025 Main Conference. 24 pages