中文

TASER:基于系统化评估与推理的翻译质量评估方法

计算与语言 2025-10-02 v1 人工智能

摘要

我们提出TASER(Translation Assessment via Systematic Evaluation and Reasoning),一种利用大规模推理模型(LRMs)进行自动化翻译质量评估的指标方法。TASER利用LRMs的显式推理能力,进行系统化、逐步的翻译质量评估。我们在WMT24 Metrics Shared Task上对TASER进行评估,涵盖参考基准和无参考场景,展示出领先的性能。在系统层面评估中,TASER在参考基准和无参考设置下均实现了最高的软成对准确率,超越了所有现有指标。在段落层面,TASER保持竞争的性能,其中我们的无参考变体在所有无参考方法中中排名第一。我们的实验揭示了,与针对传统大语言模型(LLM)证明最优的开放式方法相比,结构化提示模板对LRMs的效果更佳。我们评估了来自OpenAI的o3,这是一种大规模推理模型,探讨了不同推理 effort之间的关系,提供了关于推理深度与评估质量之间关系的见解。LRMs中明确的推理过程提供了可解释性和可见性,弥补了现有自动化指标的一个关键局限性。我们的结果表明,大规模推理模型在翻译质量评估方面实现了可衡量的进步,结合了 improved accuracy 和透明的评估,适用于多种语言对。

关键词

引用

@article{arxiv.2510.00255,
  title  = {TASER: Translation Assessment via Systematic Evaluation and Reasoning},
  author = {Monishwaran Maheswaran and Marco Carini and Christian Federmann and Tony Diaz},
  journal= {arXiv preprint arXiv:2510.00255},
  year   = {2025}
}