SEA-HELM:面向东南亚语言的综合性语言模型评估基准
计算与语言
2025-06-03 v2 人工智能
摘要
随着大型语言模型(LLM)新型能力的快速涌现,对已集成且具多语言性、多文化代表性的严谨基准测试需求日益增长。虽然现有的LLM基准测试能够评估LLM在英语以及各种中低资源语言(包括东南亚(SEA)地区语言)中的特定能力,但迄今为止尚未开发出针对SEA语言的全面且具文化代表性的评估套件。本文提出SEA-HELM,一套强调SEA语言的整体语言与文化LLM评估套件,包含五大核心支柱:(1) NLP经典,(2) LLM专项,(3) SEA语言学,(4) SEA文化,(5) 安全。SEA-HELM当前支持菲律宾语、印尼语、泰米尔语、泰语和越南语。我们还引入了SEA-HELM排行榜,用户可以系统且友好的方式了解模型在多语言、多文化情境下的性能。我们公开了SEA-HELM评估代码。
引用
@article{arxiv.2502.14301,
title = {SEA-HELM: Southeast Asian Holistic Evaluation of Language Models},
author = {Yosephine Susanto and Adithya Venkatadri Hulagadri and Jann Railey Montalan and Jian Gang Ngui and Xian Bin Yong and Weiqi Leong and Hamsawardhini Rengarajan and Peerat Limkonchotiwat and Yifan Mai and William Chandra Tjhi},
journal= {arXiv preprint arXiv:2502.14301},
year = {2025}
}