LLM Probe:面向低资源语言的 LLM 评估
计算与语言
2026-04-01 v1
摘要
尽管大型语言模型(LLM)发展迅速,但它们在低资源和形态丰富的语言中的语言能力仍因标注资源有限和缺乏标准化评估框架而未被充分理解。本文提出了 LLM Probe,一个基于词汇表的评估框架,旨在系统地评估 LLM 在低资源语言环境中的语言技能。该框架从四个语言理解领域分析模型:词汇对齐、词性识别、形态句法探测和翻译准确性。为说明该框架,我们以低资源闪米特语为案例研究,创建了一个手动标注的基准数据集。该数据集包含带有语言标注的双语词汇表,包括词性标签、语法性别和形态句法特征,展示了高标注者间一致性以确保标注的可靠性。我们测试了多种模型,包括因果语言模型和序列到序列架构。结果揭示了不同语言任务之间的显著性能差异:序列到序列模型通常在形态句法分析和翻译质量方面表现优异,而因果模型在词汇对齐方面表现强劲,但在翻译准确性方面较弱。我们的结果强调了基于语言学的评估的必要性,以更好地理解 LLM 在低资源环境中的局限性。我们将 LLM Probe 和配套基准数据集作为开源工具发布,以促进可复现的基准测试并支持开发更具包容性的多语言语言技术。
引用
@article{arxiv.2603.29517,
title = {LLM Probe: Evaluating LLMs for Low-Resource Languages},
author = {Hailay Kidu Teklehaymanot and Gebrearegawi Gebremariam and Wolfgang Nejdl},
journal= {arXiv preprint arXiv:2603.29517},
year = {2026}
}
备注
11 pages, 6 tables