中文

BenLLMEval:关于大型语言模型在孟加拉语 NLP 中潜力与缺陷的综合评估

计算与语言 2024-03-20 v2

摘要

大型语言模型(LLMs)因其令人印象深刻的语言生成及其他语言特定任务技能,已成为 NLP 中最重要的突破之一。尽管 LLMs 已在各种任务中得到评估(大多为英语),但它们尚未在孟加拉语(Bangla)等低资源语言中经历彻底评估。为此,本文引入 BenLLM-Eval,包含对 LLMs 的综合评估,以基准测试其在资源适度的孟加拉语中的性能。在这方面,我们选择了各种重要且多样的孟加拉语 NLP 任务,如文本摘要、问答、复述、自然语言推理、音译、文本分类和情感分析,用于对流行的 LLMs(即 GPT-3.5、LLaMA-2-13b-chat 和 Claude-2)进行零样本评估。我们的实验结果表明,虽然在部分孟加拉语 NLP 任务中,零样本 LLMs 能达到与当前 SOTA 微调模型相当甚至更好的性能;但在大多数任务中,其性能相当差(开源 LLMs 如 LLaMA-2-13b-chat 的性能显著糟糕),相较于当前 SOTA 结果。因此,这需要进一步努力以更好地理解 LLMs 在孟加拉语等适度资源语言中的表现。

关键词

引用

@article{arxiv.2309.13173,
  title  = {BenLLMEval: A Comprehensive Evaluation into the Potentials and Pitfalls of Large Language Models on Bengali NLP},
  author = {Mohsinul Kabir and Mohammed Saidul Islam and Md Tahmid Rahman Laskar and Mir Tafseer Nayeem and M Saiful Bari and Enamul Hoque},
  journal= {arXiv preprint arXiv:2309.13173},
  year   = {2024}
}

备注

Accepted by LREC-COLING 2024. The first two authors contributed equally