VLSP 2021 - ViMRC 挑战赛:越南语机器阅读理解
计算与语言
2023-06-19 v3
摘要
自然语言理解中的一个新兴研究趋势是机器阅读理解(MRC),即基于文本数据寻找人类问题的答案的任务。现有的越南语 MRC 研究数据集仅关注可回答问题。然而在现实中,问题可能是不可回答的,即给定文本数据中并未陈述正确答案。为弥补这一不足,我们向研究界提供一个名为 UIT-ViQuAD 2.0 的基准数据集,用于评估越南语的 MRC 任务和问答系统。我们将 UIT-ViQuAD 2.0 用作第八届越南语语言与语音处理研讨会(VLSP 2021)上越南语 MRC 挑战赛的基准数据集。该任务吸引了来自 34 所大学及其他组织的 77 支参赛队伍。本文介绍了挑战赛组织的细节、共享任务参与者所采用方法的概述以及结果。在私有测试集上,最高性能分别为 F1 分数 77.24% 和精确匹配 67.43%。前三名团队提出的越南语 MRC 系统使用了基于 transformer 架构的强大预训练语言模型 XLM-RoBERTa。UIT-ViQuAD 2.0 数据集激励研究人员进一步探索越南语机器阅读理解任务以及问答、问题生成和自然语言推理等相关任务。
引用
@article{arxiv.2203.11400,
title = {VLSP 2021 - ViMRC Challenge: Vietnamese Machine Reading Comprehension},
author = {Kiet Van Nguyen and Son Quoc Tran and Luan Thanh Nguyen and Tin Van Huynh and Son T. Luu and Ngan Luu-Thuy Nguyen},
journal= {arXiv preprint arXiv:2203.11400},
year = {2023}
}
备注
The 8th International Workshop on Vietnamese Language and Speech Processing (VLSP 2021)