面向真实场景的低资源自然语言处理实践:开发集
计算与语言
2019-09-17 v2
摘要
对于真实的低资源语言而言,获取开发集是不切实际的,因为通常将所有可用数据用于训练更为有效。然而,开发集被广泛用于那些声称处理低资源自然语言处理(NLP)的研究论文中。在此,我们旨在回答以下问题:与更现实的替代方案(即在开发语言上调优训练轮数)相比,在低资源设置下使用开发集进行早停是否会影响结果?它会导致性能的高估还是低估?我们重复了近期关于低资源 NLP 神经模型的若干实验,并比较了使用与不使用开发集训练所得模型的结果。在各语言上的平均绝对准确率差异最高达 1.4%。然而,对于某些语言和任务,差异高达 18.0% 的准确率。我们的结果凸显了在低资源 NLP 研究成果发表中采用真实实验设置的重要性。
引用
@article{arxiv.1909.01522,
title = {Towards Realistic Practices In Low-Resource Natural Language Processing: The Development Set},
author = {Katharina Kann and Kyunghyun Cho and Samuel R. Bowman},
journal= {arXiv preprint arXiv:1909.01522},
year = {2019}
}
备注
EMNLP 2019