中文

探索规则字典树:一种用于表示关联规则的快速数据结构

机器学习 2023-11-22 v2

摘要

关联规则挖掘技术在事务数据库上实现时,会生成大量的序列数据。从大量关联规则集中提取洞见已被发现是一个具有挑战性的过程。在检查规则集时,基本问题是如何高效地总结和表示有意义的已挖掘知识。许多算法和策略已被开发来解决知识提取问题;然而,该过程的有效性可能受到数据结构的限制。更好的数据结构可以充分影响知识提取过程的速度。本文提出了一种称为规则字典树(Trie of rules)的新型数据结构,用于存储由关联规则挖掘生成的规则集。所得数据结构是由预挖掘规则构成的前缀树图结构。该图将规则作为前缀树中的路径存储,使得相似规则彼此重叠。树中的每个节点表示一条规则,其中后件为该节点,前件为该节点到树根的路径。评估表明所提出的表示技术是有前景的。它以几乎无数据损失的方式压缩规则集,并在搜索特定规则和排序等基本操作的时间方面具有优势,而这是许多知识发现方法的基础。此外,我们的方法在遍历时间上表现出显著改进,与传统数据结构相比实现了 8 倍的提升。

关键词

引用

@article{arxiv.2310.17355,
  title  = {Exploring the Trie of Rules: a fast data structure for the representation of association rules},
  author = {Mikhail Kudriavtsev and Marija Bezbradica and Andrew McCarren},
  journal= {arXiv preprint arXiv:2310.17355},
  year   = {2023}
}

备注

12 pages, 13 figures, preprint of journal article