中文

基于神经嵌入的相似性查询高效处理综述

数据库 2022-04-19 v1 信息检索

摘要

相似性查询是基于某些相似性度量的查询族。不同于传统数据库查询大多基于值相等,相似性查询旨在根据某些相似性度量(例如欧氏距离、余弦相似度等)找到与给定数据对象“足够相似”的目标。为了度量数据对象之间的相似性,传统方法通常基于低层或语法特征(例如图像的基本视觉特征或文本的词袋特征),这使得它们在计算对象间的语义相似性方面能力较弱。因此,为了从语义上度量数据相似性,神经嵌入被引入。嵌入技术通过将原始数据对象表示为向量(由于主要由神经网络模型生成,被称为“嵌入”或“神经嵌入”)来暴露原始数据的隐藏语义,基于这些嵌入,其在捕捉数据相似性方面确实表现出卓越的有效性,使其成为最先进的相似性查询处理研究中应用和研究最广泛的技术之一。但在基于嵌入的相似性查询处理的效率方面仍存在许多开放性挑战,而这些挑战在有效性方面并未得到充分研究。在本综述中,我们首先概述“相似性查询”和“相似性查询处理”问题。然后我们讨论近期在嵌入(或更一般地,高维数据)之上设计高效相似性查询处理索引与算子的方法。最后,我们在选定的相似性查询应用领域(包括实体解析和信息检索)中考察使用与不使用嵌入的具体解决方案。通过比较这些方案,我们展示了神经嵌入如何使这些应用受益。

关键词

引用

@article{arxiv.2204.07922,
  title  = {A Survey on Efficient Processing of Similarity Queries over Neural Embeddings},
  author = {Yifan Wang},
  journal= {arXiv preprint arXiv:2204.07922},
  year   = {2022}
}