中文

利用数据增强进行流程信息提取

计算与语言 2024-04-12 v1

摘要

业务流程建模项目通常需要正式的过程模型作为核心组件。与创建此类正式过程模型相关的高成本促使了许多不同领域的研究,旨在从现成数据自动生成过程模型。这些包括事件日志的过程挖掘,以及从自然语言文本生成业务流程模型。后一领域的研究经常面临数据可用性有限的问题,阻碍了新技术的评估和开发,尤其是基于学习的技术。为了克服这一数据稀缺问题,本文研究了数据增强在自然语言文本数据中的应用。数据增强方法在机器学习中已经成熟,用于在无需人工协助的情况下创建新的合成数据。我们发现,这些方法中的许多适用于业务流程信息提取任务,提高了提取的准确性。我们的研究表明,数据增强是使机器学习方法能够用于从自然语言文本生成业务流程模型任务的重要组成部分,而目前该任务中大多数仍然是基于规则的系统。简单的数据增强技术将提及提取的F1F_1分数提高了2.9个百分点,关系提取的F1F_1分数提高了4.54.5。为了更好地理解数据增强如何改变人工标注的文本,我们分析了生成的文本,可视化和讨论了增强文本数据的属性。我们公开所有代码和实验结果。

关键词

引用

@article{arxiv.2404.07501,
  title  = {Leveraging Data Augmentation for Process Information Extraction},
  author = {Julian Neuberger and Leonie Doll and Benedict Engelmann and Lars Ackermann and Stefan Jablonski},
  journal= {arXiv preprint arXiv:2404.07501},
  year   = {2024}
}

备注

Accepted at BPMDS 2024 (https://sites.google.com/view/bpmds/), to be printed