中文

基于生成式 AI 的重复检测

计算与语言 2024-06-25 v1 数据库 机器学习

摘要

客户数据通常以客户关系管理系统 (CRM) 中的记录形式存储。由一名或多位用户在不同时间手动输入的数据会导致数据复制、部分重复或模糊重复。这导致客户、联系人、账户等没有唯一的真实来源。下游业务流程在没有记录在 CRM 系统中与目标客户之间唯一映射关系时变得日益复杂且笨拙。当前用于检测和去重记录的常用方法采用称为实体匹配的传统自然语言处理技术。本文展示了如何利用大型语言模型和生成式 AI 的最新进展,大幅提高重复记录的识别和修复能力。在常见基准数据集上,我们发现使用我们提出的方法进行数据去重准确率从使用 NLP 技术时的 30% 提升至接近 60%。

关键词

引用

@article{arxiv.2406.15483,
  title  = {Duplicate Detection with GenAI},
  author = {Ian Ormesher},
  journal= {arXiv preprint arXiv:2406.15483},
  year   = {2024}
}

备注

12 pages