中文

从音素到意义:评估大语言模型在泰米尔语中的表现

计算与语言 2025-11-18 v1 人工智能

摘要

大语言模型 (LLM) 在高资源语言的任务上已显示出强大的泛化能力;然而,它们在低资源语言和形态学丰富语言(如泰米尔语)中的语言能力仍鲜有探索。现有多语言基准常依赖翻译自英语的数据集,无法捕捉目标语言的语言和文化细微差别。为填补这一差距,我们介绍ILAKKANAM——首个专为泰米尔语设计的语言评估基准,由820个来自斯里兰卡学校泰米尔语教材的题目人工筛选而来。每个题目均由经过培训的语言学家在五个语言学类别和一个事实知识类别下标注,覆盖1--13年级,以确保广泛的语言覆盖。我们采用标准化的评估框架对闭源和开源LLM进行评估。我们的结果显示Gemini 2.5获得了最高的整体绩效,而开源模型落后于人类,凸显了语言 grounding 的差距。按类别和年级分析显示,所有模型在低年级题目上表现良好,但随着语言复杂度提升,绩效明显下降。进一步地,未发现模型整体绩效与其识别语言学类别的能力之间存在明显相关性,这表明绩效可能是由暴露程度驱动而非真正的理解。

关键词

引用

@article{arxiv.2511.12387,
  title  = {From Phonemes to Meaning: Evaluating Large Language Models on Tamil},
  author = {Jeyarajalingam Varsha and Menan Velayuthan and Sumirtha Karunakaran and Rasan Nivethiga and Kengatharaiyer Sarveswaran},
  journal= {arXiv preprint arXiv:2511.12387},
  year   = {2025}
}

备注

11 pages