基于扩展命名实体标签集的维基百科文章多类多语言分类
计算与语言
2020-03-09 v2
摘要
维基百科是通用世界知识的极佳来源,可引导 NLP 模型更好地理解其做出预测的动机。结构化维基百科是实现该目标的第一步,并可促进文章的细粒度分类。本工作中,我们引入了 Shinra 5 语言分类数据集(SHINRA-5LDS),这是一个使用扩展命名实体(ENE)标签集标注的日语、英语、法语、德语和波斯语大型多语言多标签维基百科文章集。我们使用为 ENE 标签集分类提供的最佳模型评估该数据集,并表明当前可用的分类模型在处理使用细粒度标签集的大型数据集时面临困难。
引用
@article{arxiv.1909.06502,
title = {Multi-class Multilingual Classification of Wikipedia Articles Using Extended Named Entity Tag Set},
author = {Hassan S. Shavarani and Satoshi Sekine},
journal= {arXiv preprint arXiv:1909.06502},
year = {2020}
}