探索规则字典树:一种用于表示关联规则的快速数据结构
机器学习
2023-11-22 v2
摘要
关联规则挖掘技术在事务数据库上实现时,会生成大量的序列数据。从大量关联规则集中提取洞见已被发现是一个具有挑战性的过程。在检查规则集时,基本问题是如何高效地总结和表示有意义的已挖掘知识。许多算法和策略已被开发来解决知识提取问题;然而,该过程的有效性可能受到数据结构的限制。更好的数据结构可以充分影响知识提取过程的速度。本文提出了一种称为规则字典树(Trie of rules)的新型数据结构,用于存储由关联规则挖掘生成的规则集。所得数据结构是由预挖掘规则构成的前缀树图结构。该图将规则作为前缀树中的路径存储,使得相似规则彼此重叠。树中的每个节点表示一条规则,其中后件为该节点,前件为该节点到树根的路径。评估表明所提出的表示技术是有前景的。它以几乎无数据损失的方式压缩规则集,并在搜索特定规则和排序等基本操作的时间方面具有优势,而这是许多知识发现方法的基础。此外,我们的方法在遍历时间上表现出显著改进,与传统数据结构相比实现了 8 倍的提升。
引用
@article{arxiv.2310.17355,
title = {Exploring the Trie of Rules: a fast data structure for the representation of association rules},
author = {Mikhail Kudriavtsev and Marija Bezbradica and Andrew McCarren},
journal= {arXiv preprint arXiv:2310.17355},
year = {2023}
}
备注
12 pages, 13 figures, preprint of journal article