中文

从网络消息日志中学习潜在事件

机器学习 2019-07-19 v3 机器学习

摘要

我们考虑将大型分布式数据中心网络中产生的错误消息分离为错误事件的问题。在此类网络中,每个错误事件会导致受该事件影响的硬件和软件组件生成一串消息。这些消息存储在一个巨大的消息日志中。我们考虑识别生成这些消息的事件签名这一无监督学习问题;此处,错误事件的签名指的是该事件生成的消息的混合。本文的主要贡献之一是将我们的问题新颖地映射,将其转换为文档中主题发现问题。我们问题中的事件对应于主题,我们问题中的消息对应于主题发现问题中的词。然而,没有直接对应于文档的等价物。因此,我们使用一种非参数变点检测算法,该算法在消息数量上具有线性计算复杂度,将消息日志划分为称为片段的较小子集,其作为文档的等价物。完成此映射后,我们使用一种称为 LDA 的知名主题发现算法来解决我们的问题。我们从理论上分析了变点检测算法,并证明其具有一致性且样本复杂度低。我们还在由某大型无线服务提供商运营的分布式数据中心网络收集的、为期 1515 天共 9797 百万条消息的真实数据集上展示了我们算法的可扩展性。

关键词

引用

@article{arxiv.1804.03346,
  title  = {Learning Latent Events from Network Message Logs},
  author = {Siddhartha Satpathi and Supratim Deb and R Srikant and He Yan},
  journal= {arXiv preprint arXiv:1804.03346},
  year   = {2019}
}

备注

To Appear in IEEE Transactions on Networking, Appeared in Workshop on MiLeTS, SIGKDD 2018