BanglaQuAD:一个孟加拉语开放域问答数据集
计算与语言
2024-10-15 v1 人工智能
摘要
孟加拉语是地球上第七大使用语言,却在自然语言处理领域被视为低资源语言。对非结构化文本进行问答是一项具有挑战性的 NLP 任务,因为它需要理解问题和段落。非常少的研究者尝试对孟加拉语(也称为 Bangla)文本进行问答。通常,现有方法通过直接将英文数据翻译成孟加拉语来构建数据集,这会产生噪声和不恰当的句子结构。此外,它们缺乏与孟加拉语及其民众相关的主题和术语。本文介绍 BanglaQuAD,一个孟加拉语问答数据集,包含 30,808 个问答对,由孟加拉语维基百科文章由母语者构建。此外,我们提出了一个便于在本地机器上构建问答数据集的标注工具。定性分析表明,我们提出的数据集质量良好。
引用
@article{arxiv.2410.10229,
title = {BanglaQuAD: A Bengali Open-domain Question Answering Dataset},
author = {Md Rashad Al Hasan Rony and Sudipto Kumar Shaha and Rakib Al Hasan and Sumon Kanti Dey and Amzad Hossain Rafi and Amzad Hossain Rafi and Ashraf Hasan Sirajee and Jens Lehmann},
journal= {arXiv preprint arXiv:2410.10229},
year = {2024}
}
备注
Accepted into LREC-COLING 2024, Turin, Italy