BHASA:面向大语言模型的东南亚语言与文化整体评估套件
计算与语言
2023-09-20 v2
摘要
大语言模型(LLMs)的快速发展及随规模涌现的新能力,催生了如HELM和BIG-bench等整体、多样且具挑战性的基准。然而目前大多数此类基准仅关注英语性能,包含东南亚(SEA)语言的评估寥寥无几。因此我们提出BHASA,一个面向SEA语言LLMs的整体语言与文化评估套件。它包含三个组成部分:(1)覆盖自然语言理解(NLU)、生成(NLG)与推理(NLR)八项任务的NLP基准,(2)LINDSEA,一个涵盖句法、语义和语用等语言现象的语言诊断工具包,(3)一个探查文化表征与敏感度的文化诊断数据集。在此初步工作中,我们仅为印尼语、越南语、泰语和泰米尔语实现NLP基准,且LINDSEA与文化诊断数据集仅纳入印尼语和泰米尔语。由于GPT-4据称是当前性能最佳的多语言LLM之一,我们以其为标尺衡量LLMs在SEA语言语境下的能力。我们对GPT-4使用BHASA的初步实验发现其在目标SEA语言的语言能力、文化表征与敏感度多方面存在不足。BHASA为进行中工作,未来将持续改进与扩展。本文代码库见:https://github.com/aisingapore/BHASA
引用
@article{arxiv.2309.06085,
title = {BHASA: A Holistic Southeast Asian Linguistic and Cultural Evaluation Suite for Large Language Models},
author = {Wei Qi Leong and Jian Gang Ngui and Yosephine Susanto and Hamsawardhini Rengarajan and Kengatharaiyer Sarveswaran and William Chandra Tjhi},
journal= {arXiv preprint arXiv:2309.06085},
year = {2023}
}
备注
86 pages, 7 figures, added link to repository in abstract, minor formatting changes and typo corrections