时间序列间隔挖掘中的语义邻接准则
机器学习
2021-01-12 v1
摘要
在基于时间间隔的多变量数据中发现频繁时间模式时,尽管句法正确,却可能不透明:对于某些模式实例,同一实体可能存在与该模式通常含义相矛盾的间隔。我们推测不透明模式作为分类或预测特征时也较无用。我们提出在频繁时间模式发现过程中的一种新的剪枝约束——语义邻接准则[SAC],其利用领域知识过滤掉含有潜在语义矛盾成分的模式。我们定义了三种SAC版本,并在三个医学领域测试了其效果。我们将这些准则嵌入一个频繁时间模式发现框架中。此前,我们曾非正式地提出SAC原理,并表明用它剪枝模式可增强在同一临床领域中模式发现的可重复性。本文中,我们正式定义三种SAC变体的语义,并在三个不同医学领域中,比较将剪枝后模式集合与完整发现模式集合用作分类和预测任务特征的效果。我们对每项任务使用四种机器学习方法(随机森林、朴素贝叶斯、SVM和逻辑回归)诱导了四个分类器。特征为各数据集中发现的频繁时间模式。基于SAC的时间模式发现将发现的模式数量最多减少97%,发现运行时间最多减少98%。但基于SAC剪枝的模式特征集在分类和预测性能上与使用完整集相当。使用SAC可显著减少发现的频繁基于间隔的时间模式数量及相应计算开销,且不损失分类或预测性能。
引用
@article{arxiv.2101.03842,
title = {The Semantic Adjacency Criterion in Time Intervals Mining},
author = {Alexander Shknevsky and Yuval Shahar and Robert Moskovitch},
journal= {arXiv preprint arXiv:2101.03842},
year = {2021}
}