一个葡萄牙语母语识别数据集
计算与语言
2018-05-01 v1
摘要
本文我们提出 NLI-PT,这是为母语识别(NLI)——即基于作者的第二语言写作识别其第一语言——编译的首个葡萄牙语数据集。该数据集包含由欧洲葡萄牙语学习者撰写的1868篇学生作文,这些学习者的母语(L1)分别为:中文、英语、西班牙语、德语、俄语、法语、日语、意大利语、荷兰语、德顿语、阿拉伯语、波兰语、韩语、罗马尼亚语和瑞典语。NLI-PT 包含原始学生文本以及四种不同类型的标注:词性(POS)、细粒度词性、成分句法分析和依存句法分析。NLI-PT 不仅可用于 NLI,也可用于第二语言习得与教育 NLP 领域的若干课题研究中。我们讨论了该数据集的可能应用,并给出了葡萄牙语 NLI 首个词汇基线的系统结果。
引用
@article{arxiv.1804.11346,
title = {A Portuguese Native Language Identification Dataset},
author = {Iria del Río and Marcos Zampieri and Shervin Malmasi},
journal= {arXiv preprint arXiv:1804.11346},
year = {2018}
}
备注
Proceedings of The 13th Workshop on Innovative Use of NLP for Building Educational Applications (BEA)