UIT-ViCoV19QA:一个越南语 COVID-19 社区问答数据集
计算与语言
2022-09-15 v1
摘要
在过去两年(2020 至 2021 年),COVID-19 突破了包括越南在内的许多国家的疾病预防措施,并对人类生活与社会社区的各个方面产生负面影响。此外,社区中的误导信息与关于大流行的假新闻也是严峻态势。因此,我们提出首个越南语社区问答数据集,用于开发 COVID-19 问答系统,称为 UIT-ViCoV19QA。该数据集包含从可信医学来源收集的 4500 个问答对,每个问题至少一个答案、至多四个独特释义答案。连同数据集,我们建立了多种深度学习模型作为基线,以评估数据集质量并通过 BLEU、METEOR 和 ROUGE-L 等常用指标启动进一步研究的基准结果。我们还展示了在这些模型上实验多个释义答案的积极效果,尤其在 Transformer——该研究领域主导架构上。
引用
@article{arxiv.2209.06668,
title = {UIT-ViCoV19QA: A Dataset for COVID-19 Community-based Question Answering on Vietnamese Language},
author = {Triet Minh Thai and Ngan Ha-Thao Chu and Anh Tuan Vo and Son T. Luu},
journal= {arXiv preprint arXiv:2209.06668},
year = {2022}
}
备注
Accepted as poster paper at The 36th annual Meeting of Pacific Asia Conference on Language, Information and Computation (PACLIC 36). The dataset and code are available at https://github.com/minhtriet2397/UIT-ViCoV19QA