关注实体以改进文本理解
计算与语言
2019-11-12 v1
摘要
NLP 近期的进展见证了基于 Transformer(Vaswani et al. 2017)的大规模预训练语言模型(GPT、BERT、XLNet 等)的发展,并且在一系列端到端任务中,此类模型取得了最先进(SOTA)结果,逼近人类表现。这展示了堆叠自注意力架构在具有足够层数和大量预训练数据时的威力。然而,在需要复杂且长距离推理、表层线索不足的任务上,预训练模型与人类表现之间仍有很大差距。Strubell et al. (2018) 最近表明,可通过有监督自注意力将句法结构知识注入模型。我们推测,将类似的语义知识(特别是共指信息)注入现有模型可提升此类复杂问题的表现。在 LAMBADA(Paperno et al. 2016)任务上,我们展示了一个从头训练、以共指作为自注意力辅助监督的模型优于最大的 GPT-2 模型,确立了新的 SOTA,而参数量仅为其极小一部分。我们还对不同模型架构变体及监督配置进行了透彻分析,为将类似技术应用于其他问题指明了未来方向。
引用
@article{arxiv.1911.04361,
title = {Attending to Entities for Better Text Understanding},
author = {Pengxiang Cheng and Katrin Erk},
journal= {arXiv preprint arXiv:1911.04361},
year = {2019}
}
备注
Accepted at AAAI 2020