中文

基于少量抽样的显著模式高效发现

机器学习 2024-06-18 v1 数据库 机器学习

摘要

显著模式挖掘是挖掘事务数据中的基本任务,需要识别与给定特征值显著相关的模式。在医学、购物篮分析和社交网络等多个应用中,目标是发现其与目标关联性定义的模式,这些模式是数据仅代表其观察或样本集合的底层人口或过程。捕捉模式与目标关联性的自然方法是考虑其统计显著性,评估其与目标在独立假设下的偏离程度。尽管已提出了多种算法来寻找统计显著模式,但仍是计算密集型任务,对于复杂模式如子群组,尚不存在有效解决方案。我们提出了FSR(高效显著模式发现算法),用于识别具有严格虚假发现概率保证的统计显著模式。FSR建立在一种捕捉一些最常考虑的模式的通用框架之上,包括项目集、顺序模式和子群组。FSR使用小数量的抽样数据集,这些数据集通过对每个事务分配独立同分布标签来获得,用于严格界定衡量模式显著性的质量统计量的最大偏差。FSR建立在需要抽样数据集数量较少的紧密上界之上,同时在发现显著模式方面提供了高效能。在测试案例中,我们考虑显著子群组挖掘,我们的评估在多个真实数据集上显示,FSR在发现显著子群组方面有效,同时只需少量抽样数据集。

关键词

引用

@article{arxiv.2406.11803,
  title  = {Efficient Discovery of Significant Patterns with Few-Shot Resampling},
  author = {Leonardo Pellegrina and Fabio Vandin},
  journal= {arXiv preprint arXiv:2406.11803},
  year   = {2024}
}

备注

Accepted to VLDB 2024