中文

尼泊尔护照问答:面向公共服务应用的低资源数据集

信息检索 2026-03-17 v1 机器学习

摘要

尼泊尔语作为一种低资源语言,在构建有效信息检索系统方面面临诸多挑战,主要由于缺乏标注数据和计算语言学资源。本研究通过构建结构化的尼泊尔语问答数据集来弥补这一差距。我们聚焦于护照相关服务的常见问题解答(FAQ),构建用于训练和评估信息检索模型的数据集。我们对基于变换器的嵌入模型进行微调,以实现问答检索中的语义相似性。比较了微调后的模型与基线BM25。此外,我们实现了一种混合检索方法,将微调模型与BM25集成,评估了混合检索的性能。我们的结果表明,基于SBERT的微调模型优于BM25,而多语言E5嵌入模型在所评估的所有模型中实现了最高的检索性能。

关键词

引用

@article{arxiv.2603.13320,
  title  = {Nepali Passport Question Answering: A Low-Resource Dataset for Public Service Applications},
  author = {Funghang Limbu Begha and Praveen Acharya and Bal Krishna Bal},
  journal= {arXiv preprint arXiv:2603.13320},
  year   = {2026}
}

备注

7 pages, 3 figures, Accepted and presented at RegICON 2025 (Regional International Conference on Natural Language Processing): NLP for East India, North East India and Southeast Asia. https://www.regicon2025.in/accepted-papers