面向越南语命名实体识别的一种深度学习方法
计算与语言
2019-12-04 v1 机器学习
机器学习
摘要
命名实体识别(NER)在基于文本的信息检索中起着重要作用。在本文中,我们结合双向长短期记忆网络(Bi-LSTM)\cite{hochreiter1997,schuster1997}与条件随机场(CRF)\cite{lafferty2001},创建了一个用于 NER 问题的新型深度学习模型。作为深度学习模型输入的每个词由一个 Word2vec 训练的向量表示。一个词嵌入集是从 2018 年通过越南新闻门户(baomoi.com)收集的约一百万篇文章中训练得到的。此外,我们将 Word2Vec\cite{mikolov2013} 训练的向量与语义特征向量(词性(POS)标注、块标注)和隐藏句法特征向量(由 Bi-LSTM 网络提取)拼接,从而在越南语 NER 系统中取得(迄今最佳的)结果。该结果在 VLSP2016(越南语与语音处理 2016 \cite{vlsp2016})竞赛数据集上得出。
引用
@article{arxiv.1912.01109,
title = {On the Vietnamese Name Entity Recognition: A Deep Learning Method Approach},
author = {Ngoc C. Lê and Ngoc-Yen Nguyen and Anh-Duong Trinh},
journal= {arXiv preprint arXiv:1912.01109},
year = {2019}
}