中文

AmharicIR+Instr:用于神经检索和指令调优的两个数据集资源

计算与语言 2026-02-11 v1 信息检索

摘要

神经检索和 GPT 风格生成模型依赖大规模高质量监督数据,而此类数据在诸如 Amharic 等低资源语言中仍然稀缺。我们发布了一个由 Amharic 组成的数据资源,包含两个支持 (i) 神经检索-排序 和 (ii) 指令遵循文本生成的研究。检索-排序数据集包含 1,091 个经过专家验证的查询-正-负文档三元组,来源于多样化的 Amharic 来源,旨在支持神经检索器的对比训练和基准测试(如 DPR、ColBERT 风格的晚期相互作用和 SPLADE 风格的稀疏神经检索)。三元组通过专家精选查询、网络来源查询和 LLM 辅助生成的组合方式创建,正/负文档来自网络或由 LLM 生成,然后由母语使用者验证。指令提示-响应数据集包含 6,285 个 Amharic 提示-响应对,涵盖多个领域和指令类型,由多个 LLM 生成并通过手动审阅和校正以确保语法正确性、相关性、流畅性和事实合理性。我们随同数据集一并发布,包含标准化的划分和格式(CSV、JSON、JSONL),以支持 Amharic 检索、排序和生成建模的可重复研究。这些数据集还附带一种可推广到其他低资源语言的方法论。

关键词

引用

@article{arxiv.2602.09914,
  title  = {AmharicIR+Instr: A Two-Dataset Resource for Neural Retrieval and Instruction Tuning},
  author = {Tilahun Yeshambel and Moncef Garouani and Josiane Mothe},
  journal= {arXiv preprint arXiv:2602.09914},
  year   = {2026}
}

备注

7 pages, Submitted to resource track