BanglaParaphrase:一个高质量的孟加拉语复述数据集
计算与语言
2022-10-12 v1
摘要
在本工作中,我们提出了 BanglaParaphrase,这是一个通过新颖的过滤流程精心构建的高质量合成孟加拉语复述数据集。我们旨在通过引入 BanglaParaphrase 来缓解孟加拉语在 NLP 领域的低资源状态,该数据集通过同时保持语义和多样性来确保质量,使其对于增强其他孟加拉语数据集尤为有用。我们展示了我们的数据集及基于其训练的模型与其他现有工作之间的详细比较分析,以确立我们合成复述数据生成流程的可行性。我们在 https://github.com/csebuetnlp/banglaparaphrase 公开发布该数据集和模型,以进一步推动孟加拉语 NLP 的发展。
引用
@article{arxiv.2210.05109,
title = {BanglaParaphrase: A High-Quality Bangla Paraphrase Dataset},
author = {Ajwad Akil and Najrin Sultana and Abhik Bhattacharjee and Rifat Shahriyar},
journal= {arXiv preprint arXiv:2210.05109},
year = {2022}
}
备注
AACL 2022 (camera-ready)