E.T.: 实体Transformer。通过实体Transformer块以共指增强的神经语言模型实现更丰富的提及表示
计算与语言
2020-11-12 v1 机器学习
摘要
在过去十年中,神经语言建模领域经历了巨大变革,随着Transformer架构的使用发展出新颖的模型。然而,即便这些模型也因内存限制与计算复杂度增加而难以建模长序列。训练数据上的共指标注可提供远超此类语言模型建模限制的上下文。本文提出一种对神经语言模型中(具体为GPT2中)所用Transformer块架构的扩展,以在训练期间融入实体标注。我们的模型GPT2E将GPT2的Transformer层架构扩展为实体Transformer,一种设计用于在存在共指信息时处理共指信息的架构。为此,我们以微不足道的训练代价实现了更丰富的实体提及表示。我们展示了GPT2与GPT2E在CoNLL 2012和LAMBADA数据集上困惑度方面的比较模型性能,以及实体表示中的关键差异及其在命名实体识别等下游任务中的影响。此外,我们的方法可被大多数基于Transformer的语言模型所采用。
引用
@article{arxiv.2011.05431,
title = {E.T.: Entity-Transformers. Coreference augmented Neural Language Model for richer mention representations via Entity-Transformer blocks},
author = {Nikolaos Stylianou and Ioannis Vlahavas},
journal= {arXiv preprint arXiv:2011.05431},
year = {2020}
}
备注
10 pages, 4 figures, 5 tables, accepted at CRAC2020