非确定性文档 spanner 的常数延迟枚举
摘要
我们考虑称为文档 spanner 的信息抽取框架,并研究从输入文档高效计算抽取结果的问题,其中抽取任务被描述为一个序列变量集自动机(VA)。我们将此问题置于枚举算法的设定中,可以先运行预处理阶段,然后必须在任意两个连续结果之间以微小延迟输出结果。我们的目标是拥有一个在组合复杂度上易处理的算法,即在输入文档和 VA 的大小上易处理;同时确保输入文档大小上尽可能好的数据复杂度界,即关于文档大小为常数延迟。PODS'18 上的几篇近期工作提出了此类算法,但具有关于文档大小的线性延迟或与(一般为非确定性的)输入 VA 大小的指数依赖。特别是,Florenzano 等人认为对于一般的序列 VA 无法达到我们期望的运行时间保证。我们反驳了这一点并证明,给定非确定性序列 VA 和输入文档,我们可以以下列界枚举 VA 在文档上的映射:预处理在文档大小上为线性、在 VA 大小上为多项式,延迟独立于文档且为 VA 大小的多项式。所得算法从而实现了组合复杂度上的易处理性与尽可能好的数据复杂度界。此外,它相当易于描述,特别是对于所谓扩展 VA 这一受限情形。
引用
@article{arxiv.1807.09320,
title = {Constant-Delay Enumeration for Nondeterministic Document Spanners},
author = {Antoine Amarilli and Pierre Bourhis and Stefan Mengel and Matthias Niewerth},
journal= {arXiv preprint arXiv:1807.09320},
year = {2020}
}
备注
25 pages including 17 pages of main material. Integrates all reviewer feedback. T paper is exactly the same as the ICDT'19 paper except that it contains 6 pages of technical appendix, and except that we corrected some additional minor mistakes following reviews of the journal version (arXiv:2003.02576). We recommend reading the journal version instead of this paper