TLUE:藏语理解评估基准
计算与语言
2025-10-03 v5
摘要
大型语言模型近年来取得了巨大进展,但低资源语言如藏语在其评估中仍然严重代表性不足。尽管藏语使用者超过七百万人,但在大型语言模型的开发和评估中,藏语在很大程度上被忽视。为填补这一空白,我们提出了藏语理解评估基准(TLUE),这是首个衡量 LLM 藏语能力的大规模基准。TLUE 包含两个主要组成部分:一个涵盖 5 个领域和 67 个子领域的综合多任务理解基准,以及一个涵盖 7 个子领域的安全基准。然后,我们评估了一组多样化的最先进大型语言模型。实验结果表明,大多数大型语言模型的表现低于随机基线,突显了它们在藏语处理方面面临的巨大挑战。TLUE 为推进藏语理解的未来研究奠定了关键基础,并强调了在大型语言模型开发中促进更大包容性的重要性。
引用
@article{arxiv.2503.12051,
title = {TLUE: A Tibetan Language Understanding Evaluation Benchmark},
author = {Fan Gao and Cheng Huang and Nyima Tashi and Xiangxiang Wang and Thupten Tsering and Ban Ma-bao and Renzeg Duojie and Gadeng Luosang and Rinchen Dongrub and Dorje Tashi and Hao Wang Xiao Feng and Yongbin Yu},
journal= {arXiv preprint arXiv:2503.12051},
year = {2025}
}
备注
Accepted by EMNLP Main Conference (Poster)