BOUQuET:面向通用翻译质量评估的数据集、基准与开放倡议
计算与语言
2025-06-17 v2
摘要
BOUQuET 是一个多向、多中心、多注册/域的数据集和基准,以及更广泛的合作倡议。这一数据集在8种非英语语言中进行手工制作。这些源语言各自代表世界上最常使用的语言,因此具有作为枢纽语言,使译文更加准确的潜力。该数据集具有多中心特性,以确保多语言语言特征的代表性。此外,该数据集超越了句子层次,按各种长度的段落进行组织。与相关机器翻译数据集相比,我们表明BOUQuET在域表示上更广泛,同时简化了非专业人士的翻译任务。因此,BOUQuET特别适合用于众包扩展,我们正在发起呼吁,旨在收集覆盖任何书面语言的多向平行语料库。
引用
@article{arxiv.2502.04314,
title = {BOUQuET: dataset, Benchmark and Open initiative for Universal Quality Evaluation in Translation},
author = {The Omnilingual MT Team and Pierre Andrews and Mikel Artetxe and Mariano Coria Meglioli and Marta R. Costa-jussà and Joe Chuang and David Dale and Cynthia Gao and Jean Maillard and Alex Mourachko and Christophe Ropers and Safiyyah Saleem and Eduardo Sánchez and Ioannis Tsiamas and Arina Turkatenko and Albert Ventayol-Boada and Shireen Yates},
journal= {arXiv preprint arXiv:2502.04314},
year = {2025}
}