中文

语言模型作为标注器:无监督上下文感知的质量短语生成

计算与语言 2024-01-01 v1

摘要

短语挖掘是一项基础文本挖掘任务,旨在从上下文中识别质量短语。然而,缺乏大量黄金标签数据集,需要专家的大量标注工作,使得该任务极具挑战性。此外,质量短语的新颖性、低频性和领域特异性进一步增加了处理该任务的难度。在本文中,我们提出了LMPhrase,一种基于大型预训练语言模型的新型无监督上下文感知质量短语挖掘框架。具体来说,我们首先通过在大规模预训练语言模型BERT上应用一种称为扰动掩码的无参数探测技术来挖掘质量短语作为银标签(称为标注器)。与典型的基于统计或远程监督的方法相比,我们的银标签源自大型预训练语言模型,考虑了语言模型中丰富的上下文信息。因此,它们在保持质量短语的信息性、一致性和完整性方面具有明显优势。其次,训练判别性跨度预测模型严重依赖大量标注数据,并且可能面临过拟合银标签的风险。作为替代,我们将短语标注任务形式化为序列生成问题,直接使用银标签微调序列到序列预训练语言模型BART(称为生成器)。最后,考虑到标注器和生成器的互补性质和不同特点,我们将两者的质量短语合并作为最终预测。大量实验表明,我们的LMPhrase在两个不同粒度的短语挖掘任务中始终优于所有现有竞争对手,每个任务在两个不同领域的数据集上进行了测试。

关键词

引用

@article{arxiv.2312.17349,
  title  = {Language Model as an Annotator: Unsupervised Context-aware Quality Phrase Generation},
  author = {Zhihao Zhang and Yuan Zuo and Chenghua Lin and Junjie Wu},
  journal= {arXiv preprint arXiv:2312.17349},
  year   = {2024}
}