中文

利用 AutoML 选择最优轨迹聚类流水线

机器学习 2021-09-03 v1 信息检索 软件工程

摘要

轨迹聚类已被广泛用于事件日志的预处理。通过分组相似行为,这些技术有助于识别子日志,从而生成更易理解的模型与一致性分析。然而,事件日志属性与聚类质量之间的关系很少受到关注。在本工作中,我们提出一个自动机器学习(Automatic Machine Learning, AutoML)框架,针对给定事件日志推荐最合适的轨迹聚类流水线,涵盖编码方法、聚类算法及其超参数。我们的实验使用了一千个事件日志、四种编码技术和三种聚类方法。结果表明,我们的框架揭示了轨迹聚类问题,并能在考虑用户场景的情况下协助选择最佳流水线。

关键词

引用

@article{arxiv.2109.00635,
  title  = {Selecting Optimal Trace Clustering Pipelines with AutoML},
  author = {Sylvio Barbon and Paolo Ceravolo and Ernesto Damiani and Gabriel Marques Tavares},
  journal= {arXiv preprint arXiv:2109.00635},
  year   = {2021}
}

备注

17 pages, 7 figures