中文

TransEvalnia:基于推理的翻译评估与排序系统

计算与语言 2025-07-18 v1

摘要

我们提出了 TransEvalnia,一个基于推理的翻译评估与排序系统。该系统在执行评估和排序时采用推理机制。该系统基于多维质量指标 (Multidimensional Quality Metrics, https://themqm.org/) 的一个子集提供细粒度评估,判断哪一种翻译最佳,并为各种维度以及整体翻译提供数值评分。我们表明 TransEvalnia 在自有的英日数据以及来自多个 WMT 共享任务的各种语言对上,表现得就像或比最新翻译排序器 (Moosa 等 2024) 好。使用Anthropic 的Claude-3.5-Sonnet 和 Qwen-2.5-72B-Instruct 作为评估 LLM,我们证明所返回的评估被人类评分者高度接受,Sonnet 以及其他 LLM 分配的分数与人类评分者分配的分数之间呈良好相关性。我们还注意到该系统——以及 TransEvalnia —— 对翻译呈现顺序的敏感性,提出了解决此位置偏差的方法。所有数据,包括系统的评估与推理、人类评估以及代码,均已发布。

关键词

引用

@article{arxiv.2507.12724,
  title  = {TransEvalnia: Reasoning-based Evaluation and Ranking of Translations},
  author = {Richard Sproat and Tianyu Zhao and Llion Jones},
  journal= {arXiv preprint arXiv:2507.12724},
  year   = {2025}
}