在 Ettu 中总结大型查询日志
数据库
2016-08-04 v1
摘要
数据库访问日志庞大、难以处理,且不易由人工检查和总结。尽管如此,它们仍是性能调优到安全审计等任务的标准首选资源。本文中,我们应对的挑战是:将大量 SQL 查询序列紧凑编码,以便呈现给人类用户。我们的方法基于 Weisfeiler-Lehman (WL) 近似图同构算法,该算法可识别图(在我们的案例中为抽象语法树)的显著特征。我们对 WL 的推广使我们能够为 SQL 查询定义距离度量,进而实现查询的自动聚类。我们还提出了两种可视化查询聚类的技术,以及一种允许以交互速度构建这些可视化的算法。最后,我们以一个激励性示例——一家美国大型银行的内部威胁检测——为背景评估了我们的算法。我们在真实世界的查询日志上通过实验表明:(a) 我们的距离度量捕捉到了有意义的相似性概念,(b) 日志总结过程具有可扩展性和高性能。
引用
@article{arxiv.1608.01013,
title = {Summarizing Large Query Logs in Ettu},
author = {Gokhan Kul and Duc Luong and Ting Xie and Patrick Coonan and Varun Chandola and Oliver Kennedy and Shambhu Upadhyaya},
journal= {arXiv preprint arXiv:1608.01013},
year = {2016}
}
备注
there are 12 pages, 8 figures, 4 tables and 28 referenced papers in bibliography