中文

面向泰语大型语言模型的文化与核心能力基准

计算与语言 2024-10-10 v2 人工智能

摘要

大型语言模型 (LLM) 的快速发展凸显了需要评估其核心能力(如推理、知识和常识)的评估框架,导致诸如 H6 基准套件等工具的出现。然而,这些基准套件主要为英语语言构建,缺乏针对在 LLM 发展中处于欠代表位置的语言(如泰语)的基准。另一方面,开发泰语 LLM 也应包括增强文化理解和核心能力。为此,我们提出了两个关键基准:Thai-H6 和泰语文化与语言智能基准 (ThaiCLI)。通过对各种具有多语言能力的 LLM 进行全面评估,我们提供了所提议基准的综合分析以及它们对泰语 LLM 发展的贡献。此外,我们将公开提供数据集和评估代码,以鼓励进一步的泰语 LLM 研究和开发。

关键词

引用

@article{arxiv.2410.04795,
  title  = {Representing the Under-Represented: Cultural and Core Capability Benchmarks for Developing Thai Large Language Models},
  author = {Dahyun Kim and Sukyung Lee and Yungi Kim and Attapol Rutherford and Chanjun Park},
  journal= {arXiv preprint arXiv:2410.04795},
  year   = {2024}
}