AmharicIR+Instr:用于神经检索和指令调优的两个数据集资源
计算与语言
2026-02-11 v1 信息检索
摘要
神经检索和 GPT 风格生成模型依赖大规模高质量监督数据,而此类数据在诸如 Amharic 等低资源语言中仍然稀缺。我们发布了一个由 Amharic 组成的数据资源,包含两个支持 (i) 神经检索-排序 和 (ii) 指令遵循文本生成的研究。检索-排序数据集包含 1,091 个经过专家验证的查询-正-负文档三元组,来源于多样化的 Amharic 来源,旨在支持神经检索器的对比训练和基准测试(如 DPR、ColBERT 风格的晚期相互作用和 SPLADE 风格的稀疏神经检索)。三元组通过专家精选查询、网络来源查询和 LLM 辅助生成的组合方式创建,正/负文档来自网络或由 LLM 生成,然后由母语使用者验证。指令提示-响应数据集包含 6,285 个 Amharic 提示-响应对,涵盖多个领域和指令类型,由多个 LLM 生成并通过手动审阅和校正以确保语法正确性、相关性、流畅性和事实合理性。我们随同数据集一并发布,包含标准化的划分和格式(CSV、JSON、JSONL),以支持 Amharic 检索、排序和生成建模的可重复研究。这些数据集还附带一种可推广到其他低资源语言的方法论。
引用
@article{arxiv.2602.09914,
title = {AmharicIR+Instr: A Two-Dataset Resource for Neural Retrieval and Instruction Tuning},
author = {Tilahun Yeshambel and Moncef Garouani and Josiane Mothe},
journal= {arXiv preprint arXiv:2602.09914},
year = {2026}
}
备注
7 pages, Submitted to resource track