中文

Log2NS:结合形式化方法以增强基于深度学习的日志分析并防止幸存者偏差

人工智能 2021-06-01 v1

摘要

分析由反应式系统生成的大型观测数据集是调试系统故障并确定其根本原因时的常见挑战。主要问题之一是这些观测数据存在幸存者偏差。例子包括分析来自网络的流量日志和来自电路设计的仿真日志。在此类应用中,用户希望从观测数据中检测非虚假相关性,并获取关于它们的可操作洞察。在本文中,我们引入日志到神经符号(Log2NS),这是一个将机器学习(ML)技术对观测数据的概率分析与基于底层形式化模型的符号推理所得确定性相结合的框架。我们通过以下步骤将所提框架应用于网络流量调试。为检测网络日志中的模式,我们首先生成实体(如IP地址、端口和应用程序)的全局嵌入向量表示。接下来,我们将大型日志流条目表示为聚类,使用户更容易可视化和检测将进一步分析的有趣场景。为泛化这些模式,Log2NS提供了从静态日志和关联引擎查询正例的能力,以及对负例和未见过实例的形式化推理能力。通过结合深度学习和符号方法的优势,Log2NS为基于日志的数据提供了一个非常强大的推理和调试工具。在真实内部数据集上的实证评估展示了Log2NS的能力。

关键词

引用

@article{arxiv.2105.14149,
  title  = {Log2NS: Enhancing Deep Learning Based Analysis of Logs With Formal to Prevent Survivorship Bias},
  author = {Charanraj Thimmisetty and Praveen Tiwari and Didac Gil de la Iglesia and Nandini Ramanan and Marjorie Sayer and Viswesh Ananthakrishnan and Claudionor Nunes Coelho},
  journal= {arXiv preprint arXiv:2105.14149},
  year   = {2021}
}

备注

10 pages, 5 tables, 4 figures