中文

ViQA-COVID:为越南语构建的新冠病毒机器阅读理解数据集

计算与语言 2025-06-17 v2 机器学习

摘要

新冠疫情出现两年后,已对全球人民及正常生活产生严重负面影响。截至2022年5月,全球累计报告超过5.2亿例确诊病例和600万例死亡(其中越南近1000万例确诊、4.3万例死亡)。经济与社会受到严峻冲击。新冠变异亚型“奥密克戎”已突破各国的防疫措施,感染数字迅速攀升。全球治疗和防疫资源正日益超载。显然,当前向人们提供人工智能支持的应用场景极为紧迫。尽管已有大量研究将人工智能应用于新冠防控,对疾病防控具有极大价值,同时也包括机器阅读理解(MRC)相关研究。我们创建了第一个关于新冠疫情的越南语MRC数据集——ViQA-COVID,可用于构建模型和系统,为防控事业贡献力量。此外,ViQA-COVID也是第一个面向越南语的多段抽取MRC数据集,期望推动越南语乃至多语言MRC研究的发展。

关键词

引用

@article{arxiv.2504.21017,
  title  = {ViQA-COVID: COVID-19 Machine Reading Comprehension Dataset for Vietnamese},
  author = {Hai-Chung Nguyen-Phung and Ngoc C. Lê and Van-Chien Nguyen and Hang Thi Nguyen and Thuy Phuong Thi Nguyen},
  journal= {arXiv preprint arXiv:2504.21017},
  year   = {2025}
}

备注

8 pages. Technical report