中文

诊断翻译基准:EU20 基准套组的自动化质量保障研究

计算与语言 2026-04-03 v1 信息检索

摘要

机器翻译基准数据集降低了成本并提供了规模,但噪声、结构丢失和质量不均会削弱信心。关键不在于我们能否翻译,而在于我们能否大规模衡量和验证翻译可靠性。我们研究了 EU20 基准套组中的翻译质量,该套组包含五个已建立的基准被翻译成 20 种语言,采用三步自动化质量保障方法:(i) 结构化语料库审计并进行针对性修复;(ii) 使用神经指标 (COMET,无参考和有参考) 进行质量轮廓分析,比较翻译服务 (DeepL / ChatGPT / Google);(iii) 基于 LLM 的跨级翻译错误景观分析。趋势一致:COMET 分数较低的数据集在跨级层面上显示更高的准确性/误译错误比例(尤其是 HellaSwag;ARC 相对干净)。基于人工编辑样本的参考-based COMET 对 MMLU 也指向相同方向。我们发布了清理/纠正后的 EU20 数据集版本,并提供可复现的代码。总之,自动化质量保障提供了实用且可扩展的指标,帮助优先考虑审查——补充而非取代人工金标准。

关键词

引用

@article{arxiv.2604.01957,
  title  = {Diagnosing Translated Benchmarks: An Automated Quality Assurance Study of the EU20 Benchmark Suite},
  author = {Klaudia Thellmann and Bernhard Stadler and Michael Färber},
  journal= {arXiv preprint arXiv:2604.01957},
  year   = {2026}
}

备注

Accepted at LREC 2026