高阶LSTM是否具有更好的序列数据分词与标注准确率?
计算与语言
2018-06-14 v3
摘要
现有的神经模型通常独立预测当前词符的标签,而不考虑相邻标签。流行的 LSTM-CRF 模型考虑了每两个连续标签之间的依赖关系。然而,现有神经模型难以考虑更长距离的标签依赖。可扩展性主要受制于复杂的模型结构以及训练期间动态规划的开销。在我们的工作中,我们首先设计了一种称为“高阶LSTM”的新模型,为当前词符预测多个标签,这些标签不仅包含当前标签,还包含之前的若干个标签。我们将一次预测中标签的数量称为“阶数”。随后我们提出了一种称为多阶双向LSTM(MO-BiLSTM)的新方法,将低阶与高阶 LSTM 结合在一起。MO-BiLSTM 通过剪枝技术保持了对高阶模型的可扩展性。我们在全短语分块与 NER 数据集上评估了 MO-BiLSTM。实验结果表明,MO-BiLSTM 在分块上取得了最先进的结果,并在两个 NER 数据集上取得了极具竞争力的结果。
引用
@article{arxiv.1711.08231,
title = {Does Higher Order LSTM Have Better Accuracy for Segmenting and Labeling Sequence Data?},
author = {Yi Zhang and Xu Sun and Shuming Ma and Yang Yang and Xuancheng Ren},
journal= {arXiv preprint arXiv:1711.08231},
year = {2018}
}
备注
Accepted by COLING 2018