中文

FormosanBench:面向大语言模型时代的低资源 Austronesian 语言基准

计算与语言 2025-06-30 v1

摘要

尽管大语言模型 (LLM) 在高资源语言的多种自然语言处理 (NLP) 任务中展现了惊人的性能,但在低资源和少数语言方面的能力仍有明显不足。Formosan 语言——位于台湾的 Austronesian 语言分支,语言丰富且面临濒危,主要由于民族语言在社会语言学中的主导地位。本工作引入 FORMOSANBENCH,这是首个用于评估大语言模型在低资源 Austronesian 语言上的基准。它覆盖三个濒危的 Formosan 语言:Atayal、Amis 和 Paiwan,涵盖三个核心 NLP 任务:机器翻译、自动语音识别 (ASR) 和文本摘要。我们在零样本、10-shot 和微调设置下评估了模型性能。结果显示,高资源语言与 Formosan 语言之间存在显著的性能差距。现有 LLM 在所有任务中均表现不佳,10-shot 学习和微调仅提供有限的改进。这些发现凸显了为能有效支持濒危和缺乏代表性语言而需构建更具包容性的 NLP 技术的紧迫需求。我们发布数据集和代码,以促进此方向的后续研究。

关键词

引用

@article{arxiv.2506.21563,
  title  = {FormosanBench: Benchmarking Low-Resource Austronesian Languages in the Era of Large Language Models},
  author = {Kaiying Kevin Lin and Hsiyu Chen and Haopeng Zhang},
  journal= {arXiv preprint arXiv:2506.21563},
  year   = {2025}
}