中文

一种用于特征评估与降维以提高Web使用挖掘结果质量的模糊方法

数据库 2015-09-03 v1 人工智能 信息检索

摘要

Web使用挖掘是将数据挖掘技术应用于Web使用日志库,以发现可用于分析用户导航行为的使用模式。在预处理阶段,原始Web日志数据被转换为一组用户画像。每个用户画像捕获一组代表用户会话的URL。可以对该会话化数据应用聚类,以捕获用户导航模式中的相似兴趣和趋势。由于会话化数据可能包含数千个用户会话,且每个用户会话可能包含数百次URL访问,因此通过消除低支持度URL来实现降维。为了过滤掉数据中的噪声,也会移除非常小的会话。但是,直接消除低支持度URL和小规模会话可能会导致大量信息丢失,特别是当低支持度URL和小会话的数量很大时。我们提出了一种模糊解决方案来处理这个问题,该方案基于模糊隶属度函数为URL和用户会话分配权重。在分配权重之后,我们应用模糊c均值聚类算法来发现用户画像的簇。在本文中,我们描述了用于执行特征选择(或降维)与会话权重分配的模糊集合论方法。最后,我们将这种基于软计算的降维方法与直接消除小会话和低支持度URL的传统方法进行了比较。我们的结果表明,模糊特征评估与降维能为所发现的簇带来更好的性能和有效性指标。

关键词

引用

@article{arxiv.1509.00690,
  title  = {A Fuzzy Approach for Feature Evaluation and Dimensionality Reduction to Improve the Quality of Web Usage Mining Results},
  author = {Zahid Ansari and M. F. Azeem and A. Vinaya Babu and Waseem Ahmed},
  journal= {arXiv preprint arXiv:1509.00690},
  year   = {2015}
}