自回归实体检索
计算与语言
2021-03-25 v3 信息检索
机器学习
机器学习
摘要
实体是我们表示和聚合知识的核心。例如,维基百科等百科全书以实体为结构单元(如每篇维基百科文章对应一个实体)。给定查询检索此类实体的能力对于实体链接和开放域问答等知识密集型任务至关重要。当前方法可理解为原子标签的分类器,每个实体对应一个标签。其权重向量是通过编码实体元信息(如描述)生成的稠密实体表示。该方法存在若干缺陷:(i) 上下文与实体的亲和性主要通过向量点积捕获,可能遗漏细粒度交互;(ii) 考虑大规模实体集时需较大内存存储稠密表示;(iii) 训练时必须对适当的难负样本子集进行重采样。本工作中,我们提出 GENRE,首个通过自回归方式从左至右逐词元生成实体唯一名称来检索实体的系统。这缓解了上述技术问题,因为:(i) 自回归公式直接捕获上下文与实体名称间关系,有效交叉编码二者;(ii) 内存占用大幅降低,因我们的编码器-解码器架构参数随词表大小而非实体数量缩放;(iii) 无需对负数据重采样即可计算 softmax 损失。我们在实体消歧、端到端实体链接和文档检索等 20 余个数据集上实验,以极小内存占用取得了新的最优或极具竞争力的结果。最后,我们展示了仅需指定名称即可添加新实体。代码与预训练模型见 https://github.com/facebookresearch/GENRE。
引用
@article{arxiv.2010.00904,
title = {Autoregressive Entity Retrieval},
author = {Nicola De Cao and Gautier Izacard and Sebastian Riedel and Fabio Petroni},
journal= {arXiv preprint arXiv:2010.00904},
year = {2021}
}
备注
Accepted (spotlight) at International Conference on Learning Representations (ICLR) 2021. Code at https://github.com/facebookresearch/GENRE. 20 pages, 9 figures, 8 tables