中文

UCPhrase:无监督上下文感知优质短语标注

计算与语言 2021-06-01 v1

摘要

从上下文中识别和理解优质短语是文本挖掘中的一项基础任务。该任务最具挑战性的部分可以说在于不常见、新兴以及领域特定的短语。这些短语的低频特性严重损害了依赖输入语料中充足短语出现次数的短语挖掘方法的性能。上下文感知标注模型虽不受频率限制,却严重依赖领域专家提供大量句子级黄金标签或手工编纂的地名词典。在本工作中,我们提出 UCPhrase,一种新颖的无监督上下文感知优质短语标注器。具体而言,我们从每个文档内一致共现的词序列中归纳出高质量短语跨度作为银标签。与基于现有知识库(KBs)的典型上下文无关远程监督相比,我们的银标签深植于输入领域与上下文,因此在保持上下文完整性和捕获新兴、超出 KB 的短语方面具有独特优势。基于银标签训练常规神经标注器通常面临过拟合短语表层名称的风险。作为替代,我们观察到由基于 transformer 的神经语言模型生成的上下文化注意力图能以表层无关的方式有效揭示词间联系。因此,我们将此类注意力图与银标签配对来训练一个轻量级跨度预测模型,该模型可应用于新输入以识别(未见过的)优质短语,而无论其表层名称或频率如何。在包括语料级短语排序、文档级关键词抽取和句子级短语标注在内的多种任务与数据集上的详尽实验,证明了我们的设计相对于最先进的预训练、无监督和远程监督方法的优越性。

关键词

引用

@article{arxiv.2105.14078,
  title  = {UCPhrase: Unsupervised Context-aware Quality Phrase Tagging},
  author = {Xiaotao Gu and Zihan Wang and Zhenyu Bi and Yu Meng and Liyuan Liu and Jiawei Han and Jingbo Shang},
  journal= {arXiv preprint arXiv:2105.14078},
  year   = {2021}
}

备注

KDD 2021