利用双向LSTM和多任务学习改进历史拼写规范化
计算与语言
2016-10-26 v1
摘要
历史文献的自然语言处理因大量变体拼写和缺乏标注数据而变得复杂。一种常见方法是将历史单词的拼写规范化为现代形式。我们探讨了深度神经网络架构(特别是应用在字符级上的深度双向LSTM网络)对该任务的适用性。当在来自早期新高地德语的多样化文本集上评估时,我们的模型与先前已建立的规范化算法相比表现良好。我们表明,利用额外的规范化数据进行多任务学习可以进一步提高我们模型的性能。
引用
@article{arxiv.1610.07844,
title = {Improving historical spelling normalization with bi-directional LSTMs and multi-task learning},
author = {Marcel Bollmann and Anders Søgaard},
journal= {arXiv preprint arXiv:1610.07844},
year = {2016}
}
备注
Accepted to COLING 2016