TransEvalnia:基于推理的翻译评估与排序系统
计算与语言
2025-07-18 v1
摘要
我们提出了 TransEvalnia,一个基于推理的翻译评估与排序系统。该系统在执行评估和排序时采用推理机制。该系统基于多维质量指标 (Multidimensional Quality Metrics, https://themqm.org/) 的一个子集提供细粒度评估,判断哪一种翻译最佳,并为各种维度以及整体翻译提供数值评分。我们表明 TransEvalnia 在自有的英日数据以及来自多个 WMT 共享任务的各种语言对上,表现得就像或比最新翻译排序器 (Moosa 等 2024) 好。使用Anthropic 的Claude-3.5-Sonnet 和 Qwen-2.5-72B-Instruct 作为评估 LLM,我们证明所返回的评估被人类评分者高度接受,Sonnet 以及其他 LLM 分配的分数与人类评分者分配的分数之间呈良好相关性。我们还注意到该系统——以及 TransEvalnia —— 对翻译呈现顺序的敏感性,提出了解决此位置偏差的方法。所有数据,包括系统的评估与推理、人类评估以及代码,均已发布。
引用
@article{arxiv.2507.12724,
title = {TransEvalnia: Reasoning-based Evaluation and Ranking of Translations},
author = {Richard Sproat and Tianyu Zhao and Llion Jones},
journal= {arXiv preprint arXiv:2507.12724},
year = {2025}
}