高维小规模表格数据中的关联规则发现
机器学习
2026-01-06 v3 人工智能
摘要
关联规则挖掘(ARM)旨在以命题规则的形式发现数据集中特征之间的模式,支持知识发现和高风险决策中的可解释机器学习。然而,在高维设置下,规则爆炸和计算开销使得流行的算法方法在没有有效搜索空间缩减的情况下不切实际,这些挑战会传播到下游任务。近年来,神经符号方法如Aerial+被提出用于解决ARM中的规则爆炸问题。虽然它们解决了数据的高维度问题,但也继承了神经网络的局限性,特别是在低数据场景下的性能下降。本文为关联规则发现做出了三项关键贡献。第一,我们从经验上证明Aerial+在五个真实数据集上的扩展性比最先进的算法和神经符号基线方法好一到两个数量级。第二,我们提出了高维低数据设置下的ARM新问题,例如生物医学领域具有约18k特征和50个样本的基因表达数据。第三,我们提出了两种利用表格基础模型对Aerial+进行微调的方法。我们的方法在五个真实数据集上显著提高了规则质量,证明了其在低数据、高维场景下的有效性。
引用
@article{arxiv.2509.20113,
title = {Discovering Association Rules in High-Dimensional Small Tabular Data},
author = {Erkan Karabulut and Daniel Daza and Paul Groth and Victoria Degeler},
journal= {arXiv preprint arXiv:2509.20113},
year = {2026}
}
备注
Published version is available at https://ceur-ws.org/Vol-4125/paper_26.pdf