LLM 不是评分器:基于生成方法的机器翻译评估新范式
计算与语言
2025-05-23 v1
摘要
近期研究将大型语言模型(LLM)应用于机器翻译质量评估(MTQE),通过提示模型分配数值分数。然而,这些直接评分方法在段落级相关性方面往往表现不佳。本文提出一种基于生成的评估范式,利用解码器型 LLM 产生高质量参考译文,随后采用句子嵌入进行语义相似度评分。我们进行了规模最大的 MTQE 评估,覆盖 8 个 LLM 和 8 个语言对。实证结果表明,我们的方法优于基于 LLM 的直接评分基线以及来自 MTME 的外部非 LLM 参考无关指标。这一发现表明生成式评估的强大潜力,支持向结合流畅生成与准确语义评估的混合方法转变。
引用
@article{arxiv.2505.16129,
title = {LLMs Are Not Scorers: Rethinking MT Evaluation with Generation-Based Methods},
author = {Hyang Cui},
journal= {arXiv preprint arXiv:2505.16129},
year = {2025}
}
备注
5 pages, 2 figures, 2 tables. Conforms to the ACL Rolling Review (ARR) short paper track. Code and data available at: https://github.com/CuiNiki/LLMs-Are-Not-Scorers