中文

用自组织映射聚类词嵌入:在LaRoSeDa——大型罗马尼亚语情感数据集上的应用

计算与语言 2021-01-13 v1

摘要

罗马尼亚语是计算语言学中研究不足的语言之一,可用于开发自然语言处理工具的语料资源很少。本文我们介绍LaRoSeDa,一个大型罗马尼亚语情感数据集,由从罗马尼亚最大电子商务平台之一收集的15000条正面与负面评论组成。我们采用两种情感分类方法作为新数据集的基线,一种基于低级特征(字符n-gram),一种基于高级特征(通过k-means聚类词嵌入生成的词嵌入袋)。作为额外贡献,我们用自组织映射(SOMs)替代k-means聚类算法,获得了更好的结果,因为生成的词嵌入簇更贴近已知支配自然语言的齐夫律分布。我们还在另一个近期推出的罗马尼亚语数据集上展示了使用SOMs聚类词嵌入的泛化能力,用于按主题的文本分类。

关键词

引用

@article{arxiv.2101.04197,
  title  = {Clustering Word Embeddings with Self-Organizing Maps. Application on LaRoSeDa -- A Large Romanian Sentiment Data Set},
  author = {Anca Maria Tache and Mihaela Gaman and Radu Tudor Ionescu},
  journal= {arXiv preprint arXiv:2101.04197},
  year   = {2021}
}

备注

Accepted at EACL 2021