中文

大规模临床笔记数据集中的去重

数据库 2017-04-20 v1 信息检索

摘要

重复,无论是完全重复还是部分重复,是许多数据集中的常见问题。在临床笔记数据中,重复(及近似重复)可能由多种原因引起,例如模板的普遍使用、复制粘贴或自动化程序生成的笔记。去除此类近似重复项的一个关键挑战是此类数据集的规模;我们自己的数据集包含超过1000万条笔记。检测和纠正此类重复项需要既准确又高度可扩展的算法。我们描述了一种基于Minhashing与局部敏感哈希(Locality Sensitive Hashing)的解决方案。在本文中,我们介绍了该方法背后的理论,并提出了一种受数据库启发的方法以使该方法可扩展。我们还提出了一种使用不相交集的聚类技术来生成稠密簇,从而加速我们的算法。

关键词

引用

@article{arxiv.1704.05617,
  title  = {Deduplication in a massive clinical note dataset},
  author = {Sanjeev Shenoy and Tsung-Ting Kuo and Rodney Gabriel and Julian McAuley and Chun-Nan Hsu},
  journal= {arXiv preprint arXiv:1704.05617},
  year   = {2017}
}

备注

Extended from the Master project report of Sanjeev Shenoy, Department of Computer Science and Engineering, University of California, San Diego. June 2016