正则表达式提取结果的连接
数据库
2017-03-31 v1
摘要
带捕获变量的正则表达式,也称为“正则公式(regex formulas)”,从文本中提取跨度(区间位置)的关系。这些关系可进一步通过关系代数进行操作,正如在文档跨度(document spanners)——Fagin 等人用于信息提取的形式化框架——的背景下所研究的那样。我们研究了在正则公式之上通过合取查询(CQs)与合取查询的并(UCQs)查询文本的复杂度。我们表明,关系世界中的下界(NP 完全性与 W[1]-困难性)在我们的设定中同样成立;特别地,困难性甚至在单字符文本上就出现!然而,关系世界中的上界并不能转移过来。与关系世界不同,非循环 CQs,甚至 gamma-非循环 CQs,都难以计算。困难性的根源在于实例化由正则公式定义的关系可能是难处理的,仅仅因为它具有指数数量的元组。不过,我们能够建立通用的上界。特别地,UCQs 可以以多项式延迟进行评估,前提是每个 CQ 具有有界数量的原子(而并集与投影可以是任意的)。此外,当参数为 UCQ 的大小时,UCQ 评估可通过 FPT(固定参数可处理)延迟求解。
引用
@article{arxiv.1703.10350,
title = {Joining Extractions of Regular Expressions},
author = {Dominik D. Freydenberger and Benny Kimelfeld and Liat Peterfreund},
journal= {arXiv preprint arXiv:1703.10350},
year = {2017}
}