越南语文本处理中判别式序列标注模型的实证研究
计算与语言
2017-08-31 v1
摘要
本文对两种广泛使用的序列预测模型——条件随机场(CRFs)和长短期记忆网络(LSTMs)——在越南语文本处理的两项基本任务(包括词性标注和命名实体识别)上进行了实证研究。我们表明,仅依赖简单的基于词的特征和极少的手工特征工程,就可以获得标注准确率的强下界,在两项任务的标准测试集上分别达到90.65%和86.03%的性能得分。特别是,我们实证证明了词嵌入在这两项任务以及两种模型中的惊人效率。我们指出,最先进的LSTMs模型并不总是显著优于传统的CRFs模型,尤其是在中等规模的数据集上。最后,我们为在实际应用中高效使用序列标注模型提供了一些建议和讨论。
引用
@article{arxiv.1708.09163,
title = {An Empirical Study of Discriminative Sequence Labeling Models for Vietnamese Text Processing},
author = {Phuong Le-Hong and Minh Pham Quang Nhat and Thai-Hoang Pham and Tuan-Anh Tran and Dang-Minh Nguyen},
journal= {arXiv preprint arXiv:1708.09163},
year = {2017}
}
备注
To appear in the Proceedings of the 9th International Conference on Knowledge and Systems Engineering (KSE) 2017