中文

实体与关系抽取中的语境化与泛化

计算与语言 2022-06-16 v1 人工智能

摘要

在过去十年中,神经网络在自然语言处理(NLP)中变得举足轻重,尤其是其能够从大规模无标注语料中学习到有用的词表示。这些词嵌入随后可在有监督训练阶段迁移并微调用于多样的最终应用。更近的2018年,整个预训练语言模型的迁移及其语境化能力的保持,使得在几乎所有NLP基准上取得了前所未有的性能,有时甚至超越人类基线。然而,随着模型取得如此惊人的分数,其理解能力仍显得肤浅,这暴露出基准的局限性:无法提供关于性能影响因素的有用洞察,也难以准确衡量理解能力。本论文中,我们研究了最先进模型在两个重要信息抽取任务——命名实体识别(NER)与关系抽取(RE)——中对训练时未见过的事实的泛化行为。传统基准在用于训练和评估模型的提及与关系间存在显著的词法重叠,而信息抽取的主要意义在于抽取先前未知的信息。我们提出了经验研究,依据与训练集的提及和关系重叠情况来分离性能,发现预训练语言模型主要有助于检测未见过(尤其是域外)的提及。尽管这使其适合真实用例,但在已见与未见提及之间仍存在性能差距,损害了向新事实的泛化。特别是,即便最先进的ERE模型也依赖于浅层的保留启发式,其预测更多基于论元的表层形式而非上下文。

关键词

引用

@article{arxiv.2206.07558,
  title  = {Contextualization and Generalization in Entity and Relation Extraction},
  author = {Bruno Taillé},
  journal= {arXiv preprint arXiv:2206.07558},
  year   = {2022}
}

备注

PhD Thesis, 122 pages