中文

面向自动化流程发现的未标注事件日志中关键属性的识别

机器学习 2023-11-20 v2

摘要

流程挖掘从历史事件日志中发现并分析流程模型。现有方法利用隐藏于事件日志中的案例标识、活动与时间戳等关键属性作为发现流程模型的线索。然而,用户需手动指定这些属性,这可能是一项繁重的任务。本文提出一种两阶段关键属性识别方法以避免此类人工排查,从而向完全自动化流程发现迈进。其中一项挑战性任务是如何避免组合爆炸导致的穷举计算。为此,我们在第一阶段利用监督机器学习缩小各关键属性的候选范围,并在第二阶段通过发现流程模型并评估来识别关键属性的最佳组合。我们的计算复杂度可从 O(N3)\mathcal{O}(N^3) 降至 O(k3)\mathcal{O}(k^3),其中 NNkk 分别为列数与我们在第一阶段保留的候选数,且通常 kk 远小于 NN。我们使用 14 个公开数据集评估了该方法,结果表明即便 k=2k = 2,我们的方法也能在约 20 秒内为许多数据集识别出关键属性。

关键词

引用

@article{arxiv.2301.12829,
  title  = {Identifying the Key Attributes in an Unlabeled Event Log for Automated Process Discovery},
  author = {Kentaroh Toyoda and Rachel Gan Kai Ying and Allan NengSheng Zhang and Tan Puay Siew},
  journal= {arXiv preprint arXiv:2301.12829},
  year   = {2023}
}

备注

IEEE Transactions on Services Computing (Early Access version)