中文

XTreePath:一种应对真实世界结构变异的XPath泛化方法

信息检索 2017-12-29 v3 数据库

摘要

我们讨论了信息抽取中的一个关键问题,即由内容模板变化引起的包装器失效。很大一部分包装器失效是由于HTML模板改变,导致在DOM(HTML的树表示)中发生元素增删后包装器变得不兼容。我们对偏移原因进行了大规模实证分析,并基于熵从数学上量化了领域难度级别。我们提出了XTreePath标注方法,以从训练DOM中捕获上下文节点信息。随后,在测试时我们以有监督的方式利用该标注,结合我们提出的递归树匹配方法,使用树编辑距离递归地定位上下文最相似的节点。该搜索基于一个启发式函数,该函数考虑了树与训练数据中存在的结构之间的相似性。我们使用来自8个垂直市场75个不同网站的117,422个页面评估了XTreePath。在黑盒测试中,就成功抽取而言,我们的XTreePath方法始终优于XPath和当前一个商业系统。我们将代码和数据集在线公开提供。

关键词

引用

@article{arxiv.1505.01303,
  title  = {XTreePath: A generalization of XPath to handle real world structural variation},
  author = {Joseph Paul Cohen and Wei Ding and Abraham Bagherjeiran},
  journal= {arXiv preprint arXiv:1505.01303},
  year   = {2017}
}