中文

预处理:Web使用挖掘过程中模式发现的先决条件

数据库 2011-05-03 v1

摘要

Web日志数据通常是多样且海量的。这些数据必须被整合成一个一致、集成且全面的视图,才能用于模式发现。若在分析之前未对数据进行适当的清洗、转换和结构化,则无法期望找到有意义的模式。与大多数数据挖掘应用一样,数据预处理涉及移除和过滤冗余及不相关的数据、去除噪声、转换并解决任何不一致性。本文提出了一套完整的预处理方法,包含合并、数据清洗、用户/会话识别以及数据格式化和摘要活动,旨在通过减少数据量来提高数据质量。为验证所提预处理方法的效率,进行了若干实验,结果表明,该方法将Web访问日志文件的大小缩减至初始大小的73-82%,并提供了结构更丰富、适用于Web使用挖掘(WUM)后续阶段的日志。因此,在WUM过程中对原始数据进行预处理是本文的核心主题。

关键词

引用

@article{arxiv.1105.0350,
  title  = {Preprocessing: A Prerequisite for Discovering Patterns in Web Usage Mining Process},
  author = {C. Ramya and G. Kavitha and Dr. K. S. Shreedhara},
  journal= {arXiv preprint arXiv:1105.0350},
  year   = {2011}
}