中文

LaoBench:用于大型语言模型的大规模多维劳基基准

计算与语言 2026-04-16 v3

摘要

大型语言模型(LLMs)的快速发展并未在低资源语言中得到相应的评估,尤其是东南亚语言如劳基语。为填补这一空白,我们引入\textbf{LaoBench},即首个大规模、高质量且多维度的基准,用于评估LLM在劳基语中的语言理解与推理能力。LaoBench 包含\textbf{17,000+}经专家精选样本,涵盖三个维度:文化关联知识应用、课程对齐的K12教育以及劳基语、中文和英文之间的双语翻译。它包括开源子集和 held-out子集,其中held-out部分通过受控服务实现安全的黑箱评估,以提高公平性和数据安全。我们采用混合管道构建LaoBench,结合专家编写与智能体辅助验证,确保语言准确性、文化相关性和教育有效性。我们评估了多样化的领先开源和闭源LLM,发现即便是强大的多语言模型在文化关联推理和翻译忠实度方面也远不如人类专家。我们希望LaoBench 能催化劳基语以及其他被低估的东南亚语言的研究,实现更具包容性的多语言评估。

关键词

引用

@article{arxiv.2511.11334,
  title  = {LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models},
  author = {Jian Gao and Richeng Xuan and Zhaolu Kang and Dingshi Liao and Wenxin Huang and Zongmou Huang and Yangdi Xu and Bowen Qin and Zheqi He and Xi Yang and Changjin Li and Yonghua Lin},
  journal= {arXiv preprint arXiv:2511.11334},
  year   = {2026}
}

备注

ACL 2026 Main