中文

召回、扩展与多候选交叉编码:快速且准确的超细粒度实体类型推断

计算与语言 2022-12-20 v1 人工智能

摘要

超细粒度实体类型推断(UFET)预测给定实体提及(如 Joe Biden)在上下文中的极其自由的类型(如 president, politician)。最先进(SOTA)方法使用基于交叉编码器(CE)的架构。CE 将提及(及其上下文)与每种类型拼接,并将这些对输入预训练语言模型(PLM)以评分其相关性。它带来了提及与类型之间更深层的交互以达到更好的性能,但必须执行 N(类型集大小)次前向传播来推断单个提及的类型。因此,当类型集很大(例如 UFET 中 N = 10k)时,CE 的推理速度非常慢。为此,我们提出以召回-扩展-过滤的方式进行实体类型推断。召回和扩展阶段修剪大的类型集并为每个提及生成 K(K 通常小于 256)个最相关的候选类型。在过滤阶段,我们使用一种称为 MCCE 的新颖模型,仅在一次前向传播中同时编码并评分这 K 个候选类型,以获得最终的类型预测。我们研究了 MCCE 的不同变体,大量实验表明,我们范式下的 MCCE 在超细粒度实体类型推断上达到了 SOTA 性能,并且比交叉编码器快数千倍。我们还发现 MCCE 在细粒度(130 种类型)和粗粒度(9 种类型)实体类型推断中非常有效。我们的代码可在 \url{https://github.com/modelscope/AdaSeq/tree/master/examples/MCCE} 获取。

关键词

引用

@article{arxiv.2212.09125,
  title  = {Recall, Expand and Multi-Candidate Cross-Encode: Fast and Accurate Ultra-Fine Entity Typing},
  author = {Chengyue Jiang and Wenyang Hui and Yong Jiang and Xiaobin Wang and Pengjun Xie and Kewei Tu},
  journal= {arXiv preprint arXiv:2212.09125},
  year   = {2022}
}