基于 Bi-LSTM 的领先中文分词方法
计算与语言
2018-08-27 v2 人工智能
摘要
针对中文分词任务已提出多种神经网络架构。令人惊讶的是,我们发现双向 LSTM 模型结合标准深度学习技术与最佳实践,能在许多流行数据集上取得比基于更复杂神经网络架构的模型更高的准确率。此外,我们的错误分析表明未登录词对神经网络模型仍具挑战性,且许多遗留错误不太可能通过架构改变来修正。相反,应更多致力于探索资源以实现进一步改进。
引用
@article{arxiv.1808.06511,
title = {State-of-the-art Chinese Word Segmentation with Bi-LSTMs},
author = {Ji Ma and Kuzman Ganchev and David Weiss},
journal= {arXiv preprint arXiv:1808.06511},
year = {2018}
}