中文

基于视觉特征的网页表格分类

计算机视觉与模式识别 2021-03-10 v1

摘要

网页上的表格构成了许多应用(如事实搜索和知识库扩充)的宝贵数据源。然而,由于包含关系知识的真实表格仅占网页表格的一小部分,可靠的真实网页表格分类是表格抽取的关键第一步。以往工作通常依赖于从 HTML 代码中显式构造特征。相比之下,我们提出了一种通过利用表格的完整视觉外观来进行网页表格分类的方法,该方法纯粹通过对网页表格的渲染图像应用卷积神经网络来工作。由于这些视觉特征可以自动提取,我们的方法避免了对显式特征构造的需求。为此任务生成了一个包含 13,112 个表格的 HTML 源代码和图像的新手工标注黄金标准数据集。迁移学习技术被应用于知名的 VGG16 和 ResNet50 架构。对使用微调 ResNet50 的 CNN 图像分类的评估(F1 93.29%)表明,该方法取得了与使用基于显式定义的 HTML 代码特征的先前方案相当的结果。通过结合视觉和显式特征,随机森林分类可达到 93.70% 的 F 值,超越了当前最先进的方法。

关键词

引用

@article{arxiv.2103.05110,
  title  = {Web Table Classification based on Visual Features},
  author = {Babette Bühler and Heiko Paulheim},
  journal= {arXiv preprint arXiv:2103.05110},
  year   = {2021}
}

备注

Accepted at International Conference of Web Engineering (ICWE 2021)