中文

分词字符串的可扩展相似连接

信息检索 2019-03-25 v1 数据库

摘要

本工作解决可自然分词为有意义子串(例如全名)的字符串的模糊连接问题。分词字符串连接在数据集成与清洗中有若干成熟应用。本工作主要受欺诈检测驱动,其中攻击者略微修改分词字符串(例如账户上的姓名)以创建大量身份,用于欺诈服务提供商(例如 Google 和 LinkedIn)。为检测此类攻击,所有账户被两两比较,得到的相似账户被视为可疑并进一步调查。比较大量账户的分词字符串特征需要一种直观的分词字符串距离以检测对手引入的细微编辑,以及一种高度可扩展的算法。现有距离度量不直观、难以调参,且其连接算法为串行因而不可扩展,无法实现这一点。我们定义了一种新颖直观的分词字符串间距离度量,归一化集合式莱文斯坦距离(Normalized Setwise Levenshtein Distance, NSLD)。据我们所知,NSLD 是首个针对分词字符串比较提出的度量。我们提出一种可扩展分布式框架,分词字符串连接器(Tokenized-String Joiner, TSJ),采用现有可扩展字符串连接算法作为构建块来执行 NSLD 连接。我们精心设计了优化与近似,显著提升了 TSJ 的效率。TSJ 框架的有效性在来自 Google 账户的数千万分词字符串姓名上的评估中显而易见。针对分词字符串的 TSJ 框架相对于通用度量空间连接算法的优越性已得到确立。

关键词

引用

@article{arxiv.1903.09238,
  title  = {Scalable Similarity Joins of Tokenized Strings},
  author = {Ahmed Metwally and Chun-Heng Huang},
  journal= {arXiv preprint arXiv:1903.09238},
  year   = {2019}
}