预训练语言模型在印尼语会话文本神经命名实体识别上的迁移
计算与语言
2019-02-22 v1
摘要
命名实体识别(NER)是自然语言处理(NLP)中的一项重要任务,在具有噪声特征的会话领域尤为具有挑战性。此外,会话文本通常数量有限,使得监督任务难以进行。要从小数据中学习,需要强的归纳偏置。此前的工作依赖手工设计特征来编码这些偏置,直至迁移学习出现。在此,我们探索了一种迁移学习方法,即语言模型预训练,用于印尼语会话文本的 NER 任务。我们利用大规模无标注数据(通用领域)迁移到会话文本,从而在有限的领域内数据上实现监督训练。我们报告了两种迁移学习变体,即监督模型微调与无监督预训练 LM 微调。我们的实验表明,当在小数据(100 个句子)上训练时,两种变体均优于基线神经模型,测试 F1 分数绝对提升 32 个点。此外,我们发现预训练 LM 编码了词性信息,而词性是 NER 的强预测因子。
引用
@article{arxiv.1902.07938,
title = {Pretrained language model transfer on neural named entity recognition in Indonesian conversational texts},
author = {Rezka Leonandya and Fariz Ikhwantri},
journal= {arXiv preprint arXiv:1902.07938},
year = {2019}
}
备注
Accepted in CICLing 2019