爱沙尼亚 WinoGrande 数据集:大语言模型在人类和机器翻译上的性能比较分析
计算与语言
2026-03-31 v2
摘要
本文提出了来自广泛使用的常识推理基准 WinoGrande 测试集的爱沙尼亚语本地化和文化适应翻译版本。我们详细描述了由翻译专家执行的翻译和适应过程,并评估了专有和开源模型在人工翻译基准上的性能。此外,我们探讨了通过纳入手动翻译过程中的见解来实现高质量机器翻译的可行性,这些见解被整合进设计以详细提示中,旨在解决 WinoGrande 数据集的语言特征和独特翻译挑战。我们的发现表明,模型在人工翻译的爱沙尼亚语数据集上的性能略低于原始英文测试集,而在机器翻译数据上的性能明显更差。此外,我们的实验表明,提示工程对翻译质量或模型准确性的改进有限,突显了在数据集翻译和适应中涉及语言专家的重要性,以确保大型语言模型在语言能力和推理方面的可靠和可解释评估。
关键词
引用
@article{arxiv.2511.17290,
title = {Estonian WinoGrande Dataset: Comparative Analysis of LLM Performance on Human and Machine Translation},
author = {Marii Ojastu and Hele-Andra Kuulmets and Aleksei Dorkin and Marika Borovikova and Dage Särg and Kairit Sirts},
journal= {arXiv preprint arXiv:2511.17290},
year = {2026}
}
备注
LREC 2026