中文

IndicSQuAD:面向印度语言的综合多语言问答数据集

计算与语言 2025-05-14 v2 机器学习

摘要

问答(QA)系统的快速进步主要惠及高资源语言,而印度语言尽管拥有庞大的母语使用者基础,却很大程度上代表性不足。在本文中,我们提出了IndicSQuAD,这是一个覆盖九种主要印度语言的综合多语言抽取式问答数据集,系统地从SQuAD数据集衍生而来。基于先前为马拉地语构建MahaSQuAD的工作,我们的方法适配并扩展了翻译技术,以在不同语言间保持高语言保真度和准确的答案跨度对齐。IndicSQuAD为每种语言提供了广泛的训练集、验证集和测试集,为模型开发提供了坚实的基础。我们使用特定语言的单语BERT模型和多语言MuRIL-BERT评估了基线性能。结果揭示了低资源环境中固有的一些挑战。此外,我们的实验表明了未来工作的潜在方向,包括扩展到更多语言、开发特定领域数据集以及整合多模态数据。数据集和模型已在https://github.com/l3cube-pune/indic-nlp上公开分享。

关键词

引用

@article{arxiv.2505.03688,
  title  = {IndicSQuAD: A Comprehensive Multilingual Question Answering Dataset for Indic Languages},
  author = {Sharvi Endait and Ruturaj Ghatage and Aditya Kulkarni and Rajlaxmi Patil and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2505.03688},
  year   = {2025}
}