Pearmut:轻松实现人类翻译评估
计算与语言
2026-04-21 v3 人机交互
摘要
人类评估是多语言NLP的黄金标准,但往往因其复杂且启动慢,被实际操作中取代,改用自动指标。我们引入Pearmut,一个轻量且功能丰富的平台,使端到端的人类评估运行起来就像自动评估一样简单。Pearmut消除了常见的进入障碍,支持评估多语言任务,尤其注重机器翻译。平台实现了标准评估协议,包括DA、ESA和MQM,并且可以扩展以支持新的协议。它具备文档级上下文、绝对评估和对比评估、注意力检查、ESAAI预标注以及静态和动态分配策略。Pearmut使人类评估能够成为模型开发和诊断中实际、常规的组成部分,而非偶发的工作。
引用
@article{arxiv.2601.02933,
title = {Pearmut: Human Evaluation of Translation Made Trivial},
author = {Vilém Zouhar and Tom Kocmi},
journal= {arXiv preprint arXiv:2601.02933},
year = {2026}
}
备注
typeset with Typst