MOROCO:摩尔多瓦与罗马尼亚方言语料库
计算与语言
2019-06-04 v2
摘要
在本工作中,我们介绍了摩尔多瓦与罗马尼亚方言语料库,该语料库可在 https://github.com/butnaruandrei/MOROCO 免费下载。该语料库包含从新闻领域收集的 33564 个文本样本(超过 1000 万个词元)。这些样本属于以下六个主题之一:文化、金融、政治、科学、体育和科技。该数据集被划分为 21719 个训练样本、5921 个验证样本和另外 5924 个测试样本。对于每个样本,我们提供了相应的方言和类别标签。这使我们能够在几个分类任务上进行实证研究,例如 摩尔多瓦与罗马尼亚文本样本的二元判别, 方言内按主题的多类分类,以及 跨方言按主题的多类分类。我们使用基于字符串核的浅层方法,以及一种基于包含 Squeeze-and-Excitation 模块的字符级卷积神经网络的全新深度方法进行了实验。我们还分析并展示了我们最佳性能模型在命名实体去除前后的最具区分性的特征。
引用
@article{arxiv.1901.06543,
title = {MOROCO: The Moldavian and Romanian Dialectal Corpus},
author = {Andrei M. Butnaru and Radu Tudor Ionescu},
journal= {arXiv preprint arXiv:1901.06543},
year = {2019}
}
备注
Accepted at ACL 2019