神经关系抽取中句子级表示的语言特征探测
计算与语言
2020-04-20 v1
摘要
尽管近期取得了进展,但对于最先进的神经关系抽取(RE)模型所捕获的特征仍知之甚少。常见方法在对关系进行分类之前,以实体提及为条件对源句子进行编码。然而,任务的复杂性使得人们难以理解编码器架构和辅助语言知识如何影响编码器所学到的特征。我们引入了14个针对与RE相关的语言属性的探测任务,并用它们来研究在 TACRED 和 SemEval 2010 Task 8 两个数据集上训练的40多种不同编码器架构与语言特征组合所学到的表示。我们发现,架构带来的偏置以及语言特征的引入在探测任务表现中得到了清晰体现。例如,加入上下文词表示大幅提升了聚焦于命名实体和词性信息的探测任务表现,并在RE中取得更好结果。相比之下,实体掩码改善了RE,却显著降低了与实体类型相关的探测任务表现。
引用
@article{arxiv.2004.08134,
title = {Probing Linguistic Features of Sentence-Level Representations in Neural Relation Extraction},
author = {Christoph Alt and Aleksandra Gabryszak and Leonhard Hennig},
journal= {arXiv preprint arXiv:2004.08134},
year = {2020}
}
备注
Accepted at ACL 2020