中文

低资源场景下的多语言问答:Dzongkha-English 基准数据集

计算与语言 2025-05-30 v2

摘要

本工作提供 DZEN,一个包含 5000 多道平行Dzongkha和英语测试问题的数据集,覆盖于不丹中小学生。收集的题目涵盖多种科学主题,包括事实性、应用性和推理性问题。我们使用该平行数据集测试了多种大语言模型 (LLM),发现模型在英语和Dzongkha之间的性能存在显著差异。我们还探讨了不同的提示策略,发现链式思维 (CoT) 提示对推理类问题效果良好,但对事实类问题效果有限。我们还发现增加英语翻译能提升Dzongkha问题回答的准确性。我们的结果指向了进一步提升LLM在Dzongkha以及更广泛低资源语言中性能的激动人心的研究方向。数据集已发布于:https://github.com/kraritt/llm_dzongkha_evaluation。

关键词

引用

@article{arxiv.2505.18638,
  title  = {Multilingual Question Answering in Low-Resource Settings: A Dzongkha-English Benchmark for Foundation Models},
  author = {Md. Tanzib Hosain and Rajan Das Gupta and Md. Kishor Morol},
  journal= {arXiv preprint arXiv:2505.18638},
  year   = {2025}
}

备注

24 pages, 20 figures