迈向印地语NER的深度学习:一种应对标注数据稀缺的方法
计算与语言
2017-11-13 v2 机器学习
摘要
本文描述了一种基于双向 RNN-LSTM 的端到端命名实体识别(NER)神经模型。几乎所有针对印地语的 NER 系统都使用语言特定特征和带有地名词典的手动规则。我们的模型与语言无关,不使用领域特定特征或任何手动规则。我们的模型依赖于以词向量形式存在的语义信息,这些词向量通过在未标注语料上的无监督学习算法获得。我们的模型在英印地语上均达到了最先进性能,且未使用任何形态学分析或任何类型的地名词典。
引用
@article{arxiv.1610.09756,
title = {Towards Deep Learning in Hindi NER: An approach to tackle the Labelled Data Scarcity},
author = {Vinayak Athavale and Shreenivas Bharadwaj and Monik Pamecha and Ameya Prabhu and Manish Shrivastava},
journal= {arXiv preprint arXiv:1610.09756},
year = {2017}
}
备注
7 pages