中文

TARAZ:波斯短答题基准用于文化语言模型评估

计算与语言 2026-03-17 v2 机器学习

摘要

本文提出了一个全面的评估框架,用于评估大型语言模型(LLM)在波斯语中的文化能力。现有的波斯语文化基准主要依赖多选格式和以英语为中心的指标,无法捕捉波斯语的形态复杂性和语义细微差别。我们的框架引入了波斯语特定的短答题评估,结合基于规则的形态规范化与混合语法和语义相似性模块,实现超越精确字符串重叠的鲁棒软匹配评分。通过在三个以文化为基础的波斯语数据集上系统评估15个最先进的开源和闭源模型,我们展示了与精确匹配基线相比,我们的混合评估提高了 +10 的评分一致性,通过捕捉表层方法无法检测的意义。我们的人类评估进一步确认,提出的语义相似性指标与人类判断的一致性高于 LLM-based 评判器。我们公开发布了我们的评估框架,为衡量波斯语文化理解提供了第一个标准化基准,并为跨文化 LLM 评估研究建立了可重复的基础。

关键词

引用

@article{arxiv.2602.22827,
  title  = {TARAZ: Persian Short-Answer Question Benchmark for Cultural Evaluation of Language Models},
  author = {Reihaneh Iranmanesh and Saeedeh Davoudi and Pasha Abrishamchian and Ophir Frieder and Nazli Goharian},
  journal= {arXiv preprint arXiv:2602.22827},
  year   = {2026}
}

备注

12 pages, 6 figures, Fifteenth biennial Language Resources and Evaluation Conference (LREC) 2026 (to appear)