中文

越南语文本分段与多选阅读理解数据集

计算与语言 2025-06-23 v1 人工智能

摘要

越南语是全球第 20 大语言,拥有超过 1.02 亿名母语使用者,但在诸如文本分段和机器阅读理解(MRC)等关键自然语言处理任务方面缺乏稳健资源。为弥合这一差距,我们提出了 VSMRC,即越南语文本分段与多选式阅读理解数据集。该数据集源自越南威克百科,包含 15,942 篇文档用于文本分段,以及 16,347 对合成多选问答对,经人工质量把关,确保其可靠且多样化。实验表明,mBERT 在两项任务中均优于单语模型,分别在 MRC 测试集上达到 88.01% 的准确率,在文本分段测试集上达到 63.15% 的 F1 分数。我们的分析表明,多语言模型在越南语等资源匮乏语言的 NLP 任务中表现出色,提示其潜在的其他应用前景。VSMRC 已在 HuggingFace 上公开。

关键词

引用

@article{arxiv.2506.15978,
  title  = {A Vietnamese Dataset for Text Segmentation and Multiple Choices Reading Comprehension},
  author = {Toan Nguyen Hai and Ha Nguyen Viet and Truong Quan Xuan and Duc Do Minh},
  journal= {arXiv preprint arXiv:2506.15978},
  year   = {2025}
}