通过机器阅读理解中的不可回答问题揭示越南语语言模型的弱点
计算与语言
2023-03-24 v1 人工智能
摘要
尽管多语性的诅咒显著限制了多语模型在单语设置下的语言能力,研究者目前仍不得不依赖多语模型来开发越南语机器阅读理解的最先进系统。这一研究困难源于开发越南语语言模型的高质量工作数量有限。为鼓励该研究领域更多的工作,我们借助机器阅读理解这一下游任务,对当前越南语单语模型的语弱点与优势进行了全面分析。基于分析结果,我们提出了开发越南语语言模型的新方向。除这一主要贡献外,我们还成功揭示了越南语机器阅读理解基准中存在伪影,并建议迫切需要有新的高质量基准来追踪越南语机器阅读理解的进展。此外,相对于先前工作,我们也对机器阅读理解中标注不可回答问题的流程做了微小但有价值的修改。我们提出的修改将不可回答问题的质量提升至更高难度,以供机器阅读理解系统求解。
引用
@article{arxiv.2303.13355,
title = {Revealing Weaknesses of Vietnamese Language Models Through Unanswerable Questions in Machine Reading Comprehension},
author = {Son Quoc Tran and Phong Nguyen-Thuan Do and Kiet Van Nguyen and Ngan Luu-Thuy Nguyen},
journal= {arXiv preprint arXiv:2303.13355},
year = {2023}
}
备注
Accepted at The 2023 EACL Student Research Workshop