向量是否比专家更懂心智?比较用于儿童心智解读能力自动评分的数据增强策略
计算与语言
2021-06-04 v1 机器学习
摘要
在本文中,我们实现并比较了 7 种不同的数据增强策略,用于儿童理解他人思想、感受和愿望(即“心智解读”)能力的自动评分任务。我们招募领域内专家重新标注增强样本,并确定每种策略在多大程度上保留了原始评分。我们还进行了多个实验,以衡量每种增强策略在多大程度上提升了自动评分系统的性能。为确定自动系统对未见过数据的泛化能力,我们创建了 UK-MIND-20——一个由 10,320 个问答对组成的儿童心智解读测试表现新语料库。我们在 MIND-CA 语料库上取得了新的最先进性能,将宏 F1 分数提高了 6 个点。结果表明,训练样本的数量和增强策略的质量均影响系统性能。任务特定的增强通常优于任务无关的增强。基于向量(GloVe、FastText)的自动增强表现最差。我们发现,在 MIND-CA 上训练的系统能很好地泛化到 UK-MIND-20。我们证明了数据增强策略也能提升在未见数据上的性能。
引用
@article{arxiv.2106.01635,
title = {Can vectors read minds better than experts? Comparing data augmentation strategies for the automated scoring of children's mindreading ability},
author = {Venelin Kovatchev and Phillip Smith and Mark Lee and Rory Devine},
journal= {arXiv preprint arXiv:2106.01635},
year = {2021}
}
备注
The paper will be presented at ACL-IJCNLP 2021