DeepLSH:用于快速高效近似重复崩溃报告检测的深层局部敏感哈希学习
软件工程
2023-10-11 v1 人工智能
摘要
自动崩溃分桶是软件开发过程中高效分派缺陷报告的关键阶段。它通常通过聚类技术对相似报告进行分组。然而,随着实时流式缺陷收集,系统需要快速回答以下问题:与一个新的缺陷最相似的缺陷有哪些?即高效查找近似重复项。因此,考虑最近邻搜索来解决此问题是自然的,尤其是著名的局部敏感哈希(LSH),因其亚线性性能和对相似性搜索精度的理论保证而适用于大型数据集。令人惊讶的是,LSH 尚未在崩溃分桶文献中被考虑。事实上,对于文献中最先进的崩溃分桶度量,推导满足所谓局部敏感性质的哈希函数并非易事。因此,我们在本文中研究如何利用 LSH 完成此任务。为了能够考虑文献中最相关的度量,我们引入了 DeepLSH,一种具有原创损失函数的连体 DNN 架构,它完美近似局部敏感性质,即使对于存在精确 LSH 解的 Jaccard 和 Cosine 度量也是如此。我们在一个原始数据集上通过一系列实验支持了这一主张,并提供该数据集。
引用
@article{arxiv.2310.06703,
title = {DeepLSH: Deep Locality-Sensitive Hash Learning for Fast and Efficient Near-Duplicate Crash Report Detection},
author = {Youcef Remil and Anes Bendimerad and Romain Mathonat and Chedy Raissi and Mehdi Kaytoue},
journal= {arXiv preprint arXiv:2310.06703},
year = {2023}
}