TCN:用于Web表格解释的表格卷积网络
信息检索
2021-02-19 v1 机器学习
摘要
从半结构化网页中抽取信息为知识图谱扩充提供了有价值的长尾事实。关系型Web表格是包含丰富多样知识的额外实体与属性的关键组成部分。然而,由于上下文信息稀疏,从关系型表格中抽取知识具有挑战性。现有工作将表格单元线性化并严重依赖修改深度语言模型(如BERT),而这类模型仅能捕捉同一表格内相关单元的信息。在本文中,我们提出一种新颖的关系型表格表示学习方法,同时考虑表内与表间上下文信息。一方面,所提表格卷积网络模型采用注意力机制自适应聚焦于同一行或列中信息量最大的表内单元;另一方面,它从跨不同表格的单元间各类隐式关联中聚合表间上下文信息。具体而言,我们提出三种新颖的聚合模块,分别用于(i)相同取值的单元、(ii)相同模式位置的单元、以及(iii)链接到相同页面主题的单元。我们进一步设计了一个有监督多任务训练目标,用于联合预测列类型与成对列关系,以及用于预训练的表格单元恢复目标。在真实Web表格数据集上的实验表明,我们的方法在列类型预测的F1上比竞争基线高出+4.8%,在成对列关系预测的F1上高出+4.1%。
引用
@article{arxiv.2102.09460,
title = {TCN: Table Convolutional Network for Web Table Interpretation},
author = {Daheng Wang and Prashant Shiralkar and Colin Lockard and Binxuan Huang and Xin Luna Dong and Meng Jiang},
journal= {arXiv preprint arXiv:2102.09460},
year = {2021}
}