中文

从文本中提取流程:基准测试前沿技术并铺就未来挑战之路

人工智能 2023-10-26 v2

摘要

从文本中提取流程模型指的是将非结构化文本流程描述中包含的信息转化为形式化表示(即流程模型)的问题。已有若干自动化方法被提出以解决该问题,但它们在范围和基本假设上高度异质,即输入、目标输出及评估所用数据存在差异。因此,目前尚不清楚现有解决方案解决模型提取问题的能力如何,以及它们彼此间如何比较。我们通过以系统方式比较 10 种 SOTA 模型提取方法克服了这一问题,涵盖定性与定量两方面。定性评估比较了对主要研究的分析:1 各解决方案的主要特征;2 从输入数据提取的流程模型元素类型;3 为评估所提框架而进行的实验评估。结果显示技术、提取元素及所进行评估的异质性,往往无法比较。为克服此困难,我们提出在流程模型实体与关系提取的统一任务上对论文所提工具进行定量比较,以便直接比较。结果显示工具按性能分为三个明显组别,没有工具获得非常好分数且存在严重局限。此外,所提评估流水线可被视为基于明确数据集与指标的参考任务,可用于比较新工具。本文还就定性与定量评估结果,对社区未来需解决的局限与挑战进行反思,以在该领域取得显著进展。

关键词

引用

@article{arxiv.2110.03754,
  title  = {Process Extraction from Text: Benchmarking the State of the Art and Paving the Way for Future Challenges},
  author = {Patrizio Bellan and Mauro Dragoni and Chiara Ghidini and Han van der Aa and Simone Paolo Ponzetto},
  journal= {arXiv preprint arXiv:2110.03754},
  year   = {2023}
}