中文

创建无偏公开基准数据集并防止数据泄漏以用于预测性过程监控

人工智能 2021-07-06 v1

摘要

人工智能尤其是机器学习的进展,正日益将研究兴趣与努力引向预测性过程监控——过程挖掘(PM)中关注预测下一事件、过程结果和剩余执行时间的子领域。遗憾的是,研究者使用多种数据集及将其划分为训练集与测试集的方式,且这些预处理步骤的文档记录并不总是完整,导致研究结果难以甚至无法复现与跨论文比较。有时,非公开领域知识的使用进一步阻碍了观点的公平竞争。训练集与测试集常未完全分离,这是预测性过程监控特有的数据泄漏问题。此外,测试集通常在案例时长构成与运行案例数量两方面存在偏差。这些障碍对该领域进展构成挑战。本文的贡献在于识别并论证这些障碍的重要性,并提出以原则性方式达成无偏基准数据集的预处理步骤,从而构建无数据泄漏且具有代表性的测试集,旨在营造公平竞争环境、促进开放科学并推动预测性过程监控的更快速进展。

关键词

引用

@article{arxiv.2107.01905,
  title  = {Creating Unbiased Public Benchmark Datasets with Data Leakage Prevention for Predictive Process Monitoring},
  author = {Hans Weytjens and Jochen De Weerdt},
  journal= {arXiv preprint arXiv:2107.01905},
  year   = {2021}
}

备注

Accepted for AI4BPM workshop at BMP2021 conferences