中文

科学与工程领域的种子引导细粒度实体类型识别

计算与语言 2024-02-21 v2 软件工程

摘要

从文本片段中准确对实体提及进行类型识别是各种自然语言处理应用的一项基础任务。许多先前的方法依赖于大量人工标注数据来执行实体类型识别。然而,在高度专业化的科学与工程领域(例如软件工程和安全)收集此类数据可能既耗时又昂贵,更不用说如果模型需要应用于机密数据集时训练数据与推理数据之间的领域差距。在本文中,我们研究科学与工程领域中种子引导的细粒度实体类型识别任务,该任务仅将每种实体类型的名称和少量种子实体作为唯一监督,旨在将新的实体提及分类为已见和未见类型(即没有种子实体的类型)。为了解决这个问题,我们提出了SEType,它首先利用预训练语言模型的上下文表示,从无标注语料库中为每种已见类型找到更多实体,从而丰富弱监督。然后,它将丰富的实体与无标注文本进行匹配以获得伪标记样本,并训练一个能够对已见和未见类型进行推断的文本蕴含模型。在涵盖四个领域的两个数据集上的大量实验证明了SEType与各种基线相比的有效性。

关键词

引用

@article{arxiv.2401.13129,
  title  = {Seed-Guided Fine-Grained Entity Typing in Science and Engineering Domains},
  author = {Yu Zhang and Yunyi Zhang and Yanzhen Shen and Yu Deng and Lucian Popa and Larisa Shwartz and ChengXiang Zhai and Jiawei Han},
  journal= {arXiv preprint arXiv:2401.13129},
  year   = {2024}
}

备注

9 pages; Accepted to AAAI 2024 (Code: https://github.com/yuzhimanhua/SEType)