中文

MuLVE,一个多语言词汇评测数据集

计算与语言 2022-09-14 v1 人工智能 机器学习

摘要

词汇学习对外语学习至关重要。正确且充分的反馈对于成功且令人满意的词汇训练必不可少。然而,许多词汇与语言评测系统基于简单规则运行,并未考虑真实用户学习数据。本工作介绍了多语言词汇评测数据集(MuLVE),该数据集由词汇卡片与真实用户回答组成,并标注用户回答正确与否。数据来源为 Phase6 词汇训练器的用户学习数据。该数据集包含以德语、英语、西班牙语和法语为目标语言的词汇问题,并提供四种关于预处理与去重的变体。我们实验使用所提出的 MuLVE 数据集微调预训练 BERT 语言模型以完成词汇评测下游任务。结果取得了 >95.5 准确率与 F2-score 的优异表现。该数据集发布于欧洲语言网格。

关键词

引用

@article{arxiv.2201.06286,
  title  = {MuLVE, A Multi-Language Vocabulary Evaluation Data Set},
  author = {Anik Jacobsen and Salar Mohtaj and Sebastian Möller},
  journal= {arXiv preprint arXiv:2201.06286},
  year   = {2022}
}

备注

Submitted to LREC 2022