中文

一种用于非参数时间序列分类的潜在源模型

机器学习 2013-12-16 v5 机器学习 社会与信息网络

摘要

对于时间序列分类,最近邻方法在实践中被广泛使用,其性能通常与神经网络、决策树和支持向量机等更复杂的方法相当或更好。我们为类似最近邻的时间序列分类的有效性建立了理论依据。我们的指导性假设是,在许多应用中,例如预测哪些话题将成为 Twitter 上的趋势,相对于我们能够获取的时间序列数量而言,原型时间序列实际上并没有那么多,例如,话题在 Twitter 上成为趋势仅有少数几种不同方式,而我们却能收集海量的 Twitter 数据。为了操作化这一假设,我们提出了一种时间序列的潜在源模型,该模型自然地引出一个“加权多数投票”分类规则,该规则可由最近邻分类器近似。我们在该模型下建立了加权多数投票和最近邻分类的非渐近性能保证,其中考虑了我们观察到的时间序列比例以及模型复杂度。在合成数据上的实验结果表明,加权多数投票在观察较少时间序列的情况下,达到了与最近邻分类相同的误分类率。然后,我们使用加权多数投票来预测 Twitter 上的哪些新闻话题会成为趋势,我们能够提前检测到此类“趋势话题”的概率为 79%,平均提前优势为 1 小时 26 分钟,真正率为 95%,假正率为 4%。

关键词

引用

@article{arxiv.1302.3639,
  title  = {A Latent Source Model for Nonparametric Time Series Classification},
  author = {George H. Chen and Stanislav Nikolov and Devavrat Shah},
  journal= {arXiv preprint arXiv:1302.3639},
  year   = {2013}
}

备注

Advances in Neural Information Processing Systems (NIPS 2013)