中文

面向低资源语言的基准数据集质量评估:以土耳其语为例

计算与语言 2025-04-29 v2 人工智能

摘要

依赖从英文或多语言资源翻译或改编的数据集,带来了关于语言和文化适切性的挑战。本研究 addresses(解决)构建稳健且文化适切基准测试的需求,通过评估 17 个常用土耳其语基准数据集的质量。我们采用全面的框架评估六个标准,人类标注员和 LLM 评判员提供详细的评估,以识别数据集的优势与不足。我们的结果表明,70% 的基准数据集未能满足我们的启发式质量标准。技术术语使用的正确性是最强的标准,但在所检查的数据集中,有 85% 的标准未被满足。尽管 LLM 评判员显示出潜力,但在理解文化常识知识和解读流畅、无歧义文本方面,仍不如人类标注员有效。GPT-4o 在语法和技术任务方面的标注能力更强,而 Llama3.3-70B 在正确性和文化知识评估方面更出色。我们的发现强调,在为低资源语言创建和改编数据集时,亟需更严格的质量控制。

关键词

引用

@article{arxiv.2504.09714,
  title  = {Evaluating the Quality of Benchmark Datasets for Low-Resource Languages: A Case Study on Turkish},
  author = {Ayşe Aysu Cengiz and Ahmet Kaan Sever and Elif Ecem Ümütlü and Naime Şeyma Erdem and Burak Aytan and Büşra Tufan and Abdullah Topraksoy and Esra Darıcı and Cagri Toraman},
  journal= {arXiv preprint arXiv:2504.09714},
  year   = {2025}
}