在模式发现中整合统计显著性与判别力
机器学习
2024-01-23 v1 机器学习
摘要
模式发现在多个领域的描述性和预测性任务中均起着核心作用。可操作的模式必须满足严格的统计显著性标准,并且在存在目标变量的情况下,还需保持判别力。我们的工作解决了尚未被充分探索的领域,即通过将统计显著性和判别力标准整合到最先进的算法中来指导模式发现,同时保持模式质量。我们还解决了某些算法强加的模式质量阈值如何修正以适应这些额外标准的问题。为了测试所提出的方法,我们选择三聚类任务作为指导模式发现的案例,并扩展了著名的贪心和多目标优化三聚类算法 -Trimax 和 TriGen,这些算法使用各种模式质量标准,如均方残差 (MSR)、最小二乘线 (LSL) 和多斜率度量 (MSL)。三个案例研究的结果表明,所提出的方法在发现具有显著改进的判别力和统计显著性且无质量劣化的模式方面发挥了作用,突显了其在有监督地引导搜索中的重要性。尽管所提出的方法是受多元时间序列数据启发,但它可以直接扩展到涉及多元、N 路 (N>3)、事务性和顺序数据结构的模式发现任务。可用性:代码在 MIT 许可下免费提供,地址为 https://github.com/JupitersMight/MOF_Triclustering。
引用
@article{arxiv.2401.12000,
title = {Integrating Statistical Significance and Discriminative Power in Pattern Discovery},
author = {Leonardo Alexandre and Rafael S. Costa and Rui Henriques},
journal= {arXiv preprint arXiv:2401.12000},
year = {2024}
}