中文

预训练语言模型在印尼语会话文本神经命名实体识别上的迁移

计算与语言 2019-02-22 v1

摘要

命名实体识别(NER)是自然语言处理(NLP)中的一项重要任务,在具有噪声特征的会话领域尤为具有挑战性。此外,会话文本通常数量有限,使得监督任务难以进行。要从小数据中学习,需要强的归纳偏置。此前的工作依赖手工设计特征来编码这些偏置,直至迁移学习出现。在此,我们探索了一种迁移学习方法,即语言模型预训练,用于印尼语会话文本的 NER 任务。我们利用大规模无标注数据(通用领域)迁移到会话文本,从而在有限的领域内数据上实现监督训练。我们报告了两种迁移学习变体,即监督模型微调与无监督预训练 LM 微调。我们的实验表明,当在小数据(100 个句子)上训练时,两种变体均优于基线神经模型,测试 F1 分数绝对提升 32 个点。此外,我们发现预训练 LM 编码了词性信息,而词性是 NER 的强预测因子。

关键词

引用

@article{arxiv.1902.07938,
  title  = {Pretrained language model transfer on neural named entity recognition in Indonesian conversational texts},
  author = {Rezka Leonandya and Fariz Ikhwantri},
  journal= {arXiv preprint arXiv:1902.07938},
  year   = {2019}
}

备注

Accepted in CICLing 2019