MahaSQuAD:桥接马拉维语问答系统中的语言鸿沟
计算与语言
2024-04-23 v1 机器学习
摘要
问答系统已彻底改变信息检索,但语言和文化边界限制了其广泛可达性。本研究旨在通过稳健的数据策展方法,将英文问答数据集(SQuAD)翻译,以填补低资源语言中高效问答数据集缺乏的空白。我们引入MahaSQuAD,即首个针对印度语言马拉维语(Marathi)的完整SQuAD数据集,包含118,516个训练样本、11,873个验证样本和11,803个测试样本。我们还提供了500个经过人工核查的金标准测试集。为保持上下文并处理语言细微差别,我们确保翻译的准确性。此外,问答数据集不能简单地通过翻译转换为任何低资源语言,必须为答案翻译映射到翻译段落中的对应位置。为此,我们提出了一种通用的将SQuAD翻译到任何低资源语言的方法。因此,我们提供了一种可扩展的方法,以在问答系统中桥接低资源语言中存在的语言和文化鸿沟。该数据集和模型已公开发布于https://github.com/l3cube-pune/MarathiNLP。
引用
@article{arxiv.2404.13364,
title = {MahaSQuAD: Bridging Linguistic Divides in Marathi Question-Answering},
author = {Ruturaj Ghatage and Aditya Kulkarni and Rajlaxmi Patil and Sharvi Endait and Raviraj Joshi},
journal= {arXiv preprint arXiv:2404.13364},
year = {2024}
}
备注
Accepted at the International Conference on Natural Language Processing (ICON 2023)