中文

译后恢复:自动化基准数据集翻译的高效管道

计算与语言 2026-02-26 v1 人工智能 机器学习

摘要

多语言大型语言模型(LLM)评估的可靠性目前因翻译基准质量不一致而受到影响。现有资源常常存在语义漂移和上下文丢失,可能导致误导的性能指标。本文提出了一个全自动框架,以解决这些挑战,实现对数据集和基准的可扩展高质量翻译。我们演示,适应 test-time compute 扩展策略——Universal Self-Improvement(USI)和我们提出的多轮排序方法 T-RANK,能够显著提升输出质量,优于传统管道。我们的框架确保在本土化过程中保留基准的原始任务结构和语言细微差别。我们将该方法应用于将流行的基准和数据集翻译成八种东欧和南欧语言(乌克兰语、保加利亚语、斯洛伐克语、罗马尼亚语、立陶宛语、爱沙尼亚语、土耳其语、希腊语)。使用 reference-based 指标和 LLM-as-judge 进行评估,我们的翻译超越现有资源,导致更准确的下游模型评估。我们发布了该框架和改进后的基准,以促进稳健和可重复的多语言 AI 开发。

引用

@article{arxiv.2602.22207,
  title  = {Recovered in Translation: Efficient Pipeline for Automated Translation of Benchmarks and Datasets},
  author = {Hanna Yukhymenko and Anton Alexandrov and Martin Vechev},
  journal= {arXiv preprint arXiv:2602.22207},
  year   = {2026}
}