中文

从大语言模型中挖掘低资源语言数据:比较不同 elicitation 策略在豪萨语和方恩贝语中的效果

计算与语言 2026-04-15 v1 人工智能

摘要

大语言模型(LLM)是在来自低资源语言社区的数据训练的,但这些模型中编码的语言知识仅通过商业 API 可被访问。本文研究了战略性提示是否可以从 LLM 中提取用于豪萨语(阿尔拉斯蒙语族,约有8000万使用者)和方恩贝语(尼日-刚果语族,约有200万使用者)的可用文本数据的问题。我们系统比较了六种elicitation任务类型在两种商业 LLM(GPT-4o Mini 和 Gemini 2.5 Flash)中的效果。GPT-4o Mini 在每个 API 调用中提取的可用目标语言单词数是 Gemini 的6-41倍。不同语言的最优策略不同:豪萨语受功能文本和对话的帮助,而方恩贝语需要受约束的生成提示。我们公开了所有生成的语料库和代码。

关键词

引用

@article{arxiv.2604.12477,
  title  = {Mining Large Language Models for Low-Resource Language Data: Comparing Elicitation Strategies for Hausa and Fongbe},
  author = {Mahounan Pericles Adjovi and Roald Eiselen and Prasenjit Mitra},
  journal= {arXiv preprint arXiv:2604.12477},
  year   = {2026}
}

备注

11 pages, 5 figures, 6 tables; to appear in LREC-COLING 2026