中文

一种基于聚类的无监督产品标题匹配组合方法

信息检索 2019-03-12 v1 机器学习 机器学习

摘要

电子商务行业的持续增长使得产品检索问题尤为重要。随着更多企业将业务移至 Web,产品相关信息的量与多样性迅速增加。这些因素使用户难以辨识并比较所需产品的特征。近期研究证明标准相似度度量无法有效识别相同产品,因为相似标题常指向不同产品,反之亦然。其他研究利用外部数据源(搜索引擎)丰富标题;这些方案颇不实用,主要因外部数据获取缓慢。本文引入 UPM,一种通过标题匹配产品的无监督算法。UPM 不依赖任何外部源,因其分析标题并从中提取词的组合。这些组合依若干准则评估,其中最合适者构成产品被分类所属的簇。UPM 亦无参数,避免产品两两比较,并包含纠正错误匹配的后处理验证阶段。UPM 的实验评估证明了其在效率与效果上均优于最先进(state-of-the-art)方法。

关键词

引用

@article{arxiv.1903.04276,
  title  = {A Clustering-Based Combinatorial Approach to Unsupervised Matching of Product Titles},
  author = {Leonidas Akritidis and Athanasios Fevgas and Panayiotis Bozanis and Christos Makris},
  journal= {arXiv preprint arXiv:1903.04276},
  year   = {2019}
}