中文

用于 Web 结构化数据标注的混合表示池化

数据库 2016-10-04 v1

摘要

自动识别 Web 结构化数据的类型是 Web 数据集成过程中的关键步骤。Web 结构化数据通常与特定领域中的实体或对象相关联。在本文中,我们旨在基于属性值,将给定领域中实体的属性映射到同一领域中预定义的属性类别。为执行此任务,我们提出了一种依赖于属性值格式的混合深度学习网络。该方法无需任何预处理或使用预定义的手工特征。该混合网络结合了基于序列的神经网络,即卷积神经网络 (CNN) 和循环神经网络 (RNN),以学习属性值序列的结构。CNN 通过滑动窗口方法捕捉这些序列中的短距离依赖关系,而 RNN 通过存储先前字符的信息来捕捉长距离依赖关系。这些网络创建了输入序列的不同向量表示,并通过池化层进行组合。该层对这些向量应用特定操作,以捕捉任务中最有用的模式。最后,在池化层之上,softmax 函数预测给定属性值的标签。我们在四个不同的 Web 领域评估了我们的策略。结果表明,在所有领域中,该池化网络的表现均优于使用某种输入预处理的先前方法。

关键词

引用

@article{arxiv.1610.00493,
  title  = {Pooling Hybrid Representations for Web Structured Data Annotation},
  author = {Luciano Barbosa and Breno W. Carvalho and Bianca Zadrozny},
  journal= {arXiv preprint arXiv:1610.00493},
  year   = {2016}
}