基于大规模 XML 与模式数据的确定性正则表达式实证研究
数据库
2018-06-01 v1
摘要
正则表达式是计算机科学中的基础概念,被广泛应用于各种场景。本文关注确定性正则表达式(DREs)。考虑到此前研究者缺乏大规模数据集作为依据,我们首先从 Web 上采集了大规模真实语料,随后开展实证研究以探究 DREs 的使用情况。本工作的一个特点是,相较于以往工作,数据集规模足够大,这是通过我们提出的若干数据采集策略获得的。结果显示,Relax NG 中超过 98% 的表达式为 DRE,RegExLib 中超过 56% 的表达式为 DRE,而 Relax NG 与 RegExLib 均无限定性约束。这些观察表明 DREs 在实践中被普遍使用。结果还显示对 DREs 子类的进一步研究是必要的。据我们所知,我们首次分析了 Relax NG 与 RegExLib 中 DREs 的确定性及其子类,并给出了这些结果。此外,我们给出了关于该数据集的一些讨论与应用。我们从原始数据中得到了一个 DRE 数据集,它将在实践中发挥作用并具有独立价值。我们发现当前关于 DREs 新子类的研究不足,因此有必要做进一步研究。我们还分析了 XSD 之间的引用关系并定义了 SchemaRank,可用于 XML Schema 设计。
引用
@article{arxiv.1805.12503,
title = {Practical Study of Deterministic Regular Expressions from Large-scale XML and Schema Data},
author = {Yeting Li and Xinyu Chu and Xiaoying Mou and Chunmei Dong and Haiming Chen},
journal= {arXiv preprint arXiv:1805.12503},
year = {2018}
}
备注
9 pages,5 figures