基于双划分模型的搭便车情节筛查
数据库
2018-05-22 v1 人工智能
摘要
频繁情节挖掘的缺点之一是发现的模式中存在大量冗余。搭便车情节(free-rider episode)作为一个典型例子,由一个真实模式掺杂一些额外的噪声事件组成。由于内部噪声事件可能具有高支持度,此类搭便车情节可能具有异常高的支持度,从而无法被基于频率的框架过滤。一种过滤搭便车情节的有效技术是使用划分模型将一个情节划分为两个连续子情节,并在这两个子情节独立发生的假设下,将该情节的观测支持度与其期望支持度进行比较。本文考虑了更复杂的子情节,并提出了一种名为EDP的新划分模型,用于从给定情节集合中过滤搭便车情节。它结合了(1)一个双划分策略,将情节划分为底层真实模式和潜在噪声;(2)基于所提划分策略的搭便车情节期望支持度的新定义。若观测支持度显著高于我们模型估计的期望支持度,则可认为该情节是有趣的。在合成和真实世界数据集上的实验表明,与现有最先进方法相比,EDP能有效过滤搭便车情节。
引用
@article{arxiv.1805.07505,
title = {Free-rider Episode Screening via Dual Partition Model},
author = {Xiang Ao and Yang Liu and Zhen Huang and Luo Zuo and Qing He},
journal= {arXiv preprint arXiv:1805.07505},
year = {2018}
}
备注
The 23rd International Conference on Database Systems for Advanced Applications(DASFAA 2018), 16 Pages