SinhalaMMLU:评估僧伽罗语多任务语言理解的综合基准
计算与语言
2025-09-04 v1
摘要
大语言模型(LLMs)展现出令人印象深刻的通用知识和推理能力,但其评估主要集中于全球性或英语中心主题,往往忽视了低资源语言和文化特定内容。虽然近期多语言基准尝试弥合这一差距,但许多依赖自动翻译,可能引入误差并歪曲原始文化语境。为此,我们推出了 SinhalaMMLU——首个专门为僧伽罗语(一种低资源语言)设计的多项选择题回答基准。该数据集包含超过 7,000 个问题,涵盖中学至大学教育水平,与斯里兰卡国家课程对齐,覆盖六个领域和 30 个学科,包括一般学术主题和文化特定知识。我们在 26 个 LLMs 上评估了 SinhalaMMLU,观察到尽管 Claude 3.5 Sonnet 和 GPT-4o 分别以 67% 和 62% 的平均准确率取得最高成绩,但整体模型性能仍然有限。特别是在人文等文化丰富领域,模型表现不佳,揭示了 LLMs 适应低资源和文化特定情境方面仍有显著改进空间。
引用
@article{arxiv.2509.03162,
title = {SinhalaMMLU: A Comprehensive Benchmark for Evaluating Multitask Language Understanding in Sinhala},
author = {Ashmari Pramodya and Nirasha Nelki and Heshan Shalinda and Chamila Liyanage and Yusuke Sakai and Randil Pushpananda and Ruvan Weerasinghe and Hidetaka Kamigaito and Taro Watanabe},
journal= {arXiv preprint arXiv:2509.03162},
year = {2025}
}
备注
19 pages, 11 figures