BURMESE-SAN:评估大语言模型的缅甸语 NLP 基准
计算与语言
2026-05-25 v3
摘要
我们介绍 BURMESE-SAN,首个系统性评估缅甸语大语言模型 (LLM) 的全方位基准测试,涵盖三大核心 NLP 能力:理解 (NLU)、推理 (NLR) 和生成 (NLG)。BURMESE-SAN 汇聚了跨越这些能力的七个子任务,包括问答、情感分析、有害内容检测、因果推理、自然语言推理、抽象摘要和机器翻译,其中许多任务此前在缅甸语上尚不可用。基准通过严格的本土语言学家驱动过程构建,确保语言的自然性、流畅性和文化真实性,同时尽量降低翻译引入的副作用。我们对开源和商业 LLM 进行大规模评估,检视缅甸语建模面临的挑战,这些挑战源于预训练覆盖范围有限、形态学丰富以及句法变异等因素。结果表明,缅甸语性能更多取决于模型架构设计、语言表示和指令微调,而非模型规模alone。特别是,东南亚地区的细化微调和更新的模型生成带来了显著提升。最后,我们将 BURMESE-SAN 作为公开排行榜发布,以支持缅甸语及其他低资源语言的系统化评估和持续进步。https://leaderboard.sea-lion.ai/detailed/MY
引用
@article{arxiv.2602.18788,
title = {BURMESE-SAN: Burmese NLP Benchmark for Evaluating Large Language Models},
author = {Thura Aung and Jann Railey Montalan and Jian Gang Ngui and Peerat Limkonchotiwat},
journal= {arXiv preprint arXiv:2602.18788},
year = {2026}
}