构建面向含命名实体文本的语言模型
计算与语言
2018-05-15 v1
摘要
许多领域中的文本包含大量命名实体。由于实体名在训练语料库中出现频率较低,预测实体名对语言模型而言通常具有挑战性。在本文中,我们提出了一种新颖且有效的方法来构建判别式语言模型,该模型能够利用实体类型信息学习实体名。我们还引入了两个基于食谱和 Java 编程代码的基准数据集,并在其上评估了所提出的模型。实验结果表明,在食谱生成和代码生成任务上,我们的模型困惑度分别比 SOTA 语言模型降低了 52.2% 和 22.06%。
引用
@article{arxiv.1805.04836,
title = {Building Language Models for Text with Named Entities},
author = {Md Rizwan Parvez and Saikat Chakraborty and Baishakhi Ray and Kai-Wei Chang},
journal= {arXiv preprint arXiv:1805.04836},
year = {2018}
}