一种基于高斯相似性度量利用事务序列向量聚类客户事务的新方法
数据库
2016-04-19 v1
摘要
在序列、时态和时间序列数据库中对事务进行聚类正受到数据库研究人员和软件产业的重要关注。人们已开展大量研究,旨在定义并验证新的相似性度量方法,以用于序列、时态和时间序列数据库,从而能够准确高效地发现给定数据库中用户事务之间的相似性,以预测用户行为。事务中出现的项的分布对找出它们之间的相似程度贡献很大。这构成了所提出相似性度量的核心思想。本研究的主要目标是首先设计一种高效的相似性度量,它本质上考虑项集在整个事务数据集上的分布,同时也考虑事务中出现的项的共性,而这是 Jaccard、Cosine、Euclidean 相似性度量的主要缺点。然后我们对最坏情况、平均情况和最好情况进行分析。所设计的相似性度量基于高斯并保持高斯函数的性质。所提出的相似性度量可用于聚类和分类用户事务并预测用户行为。
引用
@article{arxiv.1604.05274,
title = {A Novel Gaussian Based Similarity Measure for Clustering Customer Transactions Using Transaction Sequence Vector},
author = {M. S. B. Phridvi Raj and Vangipuram Radhakrishna and C. V. Guru Rao},
journal= {arXiv preprint arXiv:1604.05274},
year = {2016}
}
备注
Technical Journal of the faculty of Engineering, April 2015, 12 pages, Journal Indexed in Scopus and Web of Science