无无处不在项下的频繁项集挖掘
数据结构与算法
2018-03-30 v1 数据库
摘要
频繁项集挖掘(FIM),有时称为购物篮分析(MBA)或关联规则学习(ARL),是从物品交易数据集中创建规则的机器学习(ML)方法。大多数方法基于支持度(即物品相对共现的最小次数)来识别可能在同一交易中一起出现的物品。尽管这是衡量“这些物品可能一起出现”这一假设相关性的良好指标,但大多数算法并未处理非常频繁出现的物品(称为无处不在项)这一现象。无处不在项与不频繁项具有相同的熵,对知识的贡献不大。另一方面,它们对算法性能有强烈影响,有时会阻碍FIM算法的收敛,从而无法提供有意义的结果。本文讨论了无处不在项现象,并展示了忽略这些项如何对计算性能产生显著影响,但对结果显著性的影响却较低且可控。
引用
@article{arxiv.1803.11105,
title = {Frequent Item-set Mining without Ubiquitous Items},
author = {Ran M. Bittmann and Philippe Nemery and Xingtian Shi and Michael Kemelmakher and Mengjiao Wang},
journal= {arXiv preprint arXiv:1803.11105},
year = {2018}
}