中文

VlogQA: 面向越南语口语的机器阅读理解任务、数据集与基线模型

计算与语言 2025-07-22 v3

摘要

本文介绍了用于机器阅读理解任务的越南语口语语料库的开发过程,并深入探讨了使用真实世界数据进行机器阅读理解任务的挑战和机遇。现有的越南语MRC语料库主要关注正式书面文档,如维基百科文章、在线报纸或教科书。相比之下,VlogQA包含基于来自YouTube的1,230份转录文档的10,076个问答对——YouTube是一个广泛的用户上传内容来源,涵盖食物和旅行主题。通过捕捉越南语母语者在自然环境中的口语(越南语研究中被忽视的一个角落),该语料库为未来越南语阅读理解任务的研究提供了宝贵的资源。在性能评估方面,我们的深度学习模型在测试集上取得了75.34%的最高F1分数,表明在越南语口语数据的机器阅读理解方面取得了显著进展。在EM方面,我们取得的最高分数是53.97%,这反映了处理口语内容的挑战,并强调了进一步改进的必要性。

关键词

引用

@article{arxiv.2402.02655,
  title  = {VlogQA: Task, Dataset, and Baseline Models for Vietnamese Spoken-Based Machine Reading Comprehension},
  author = {Thinh Phuoc Ngo and Khoa Tran Anh Dang and Son T. Luu and Kiet Van Nguyen and Ngan Luu-Thuy Nguyen},
  journal= {arXiv preprint arXiv:2402.02655},
  year   = {2025}
}

备注

To appear as the main conference paper at EACL 2024