使用双向长短期记忆模型与辅助损失的多语言词性标注
计算与语言
2016-07-22 v3
摘要
双向长短期记忆(bi-LSTM)网络近来已被证明在各种 NLP 序列建模任务中取得成功,但关于其对输入表示、目标语言、数据集大小和标签噪声的依赖性却知之甚少。我们解决了这些问题,并评估了带有词、字符和 unicode 字节嵌入的 bi-LSTM 在词性标注中的应用。我们在不同语言和数据规模下将 bi-LSTM 与传统词性标注器进行比较。我们还提出了一种新颖的 bi-LSTM 模型,该模型将词性标注损失函数与考虑罕见词的辅助损失函数相结合。该模型在 22 种语言上取得了最先进的性能,并且对形态复杂的语言尤其有效。我们的分析表明,bi-LSTM 对训练数据大小和标签损坏(在小噪声水平下)的敏感度低于先前的假设。
引用
@article{arxiv.1604.05529,
title = {Multilingual Part-of-Speech Tagging with Bidirectional Long Short-Term Memory Models and Auxiliary Loss},
author = {Barbara Plank and Anders Søgaard and Yoav Goldberg},
journal= {arXiv preprint arXiv:1604.05529},
year = {2016}
}
备注
In ACL 2016 (short)