中文

TabSim:一种用于精确估计表格相似度的孪生神经网络

计算与语言 2020-08-26 v1

摘要

表格是呈现结构化信息的一种流行且高效的方式,被广泛用于包括网页在内的各类文档中。表格以二维矩阵展示信息,其语义由结构(行、列)、表头、标题与内容共同传达。近期研究已开始将表格视为一等对象,而非文本的附属物,在表格匹配、表格补全或值填补等问题上取得了有趣的结果。所有这些问题的内在都依赖于对两个表格语义相似度的准确度量。我们提出 TabSim,一种利用深度神经网络计算表格相似度得分的新方法。在概念上,TabSim 将表格表示为其标题、内容与结构嵌入的学习拼接。在此表示下,训练一个孪生神经网络(Siamese neural network)来计算与表格语义相似度相关的得分。为训练和评估我们的方法,我们构建了一个由 1500 个从生物医学文章中提取的表格对组成的标准语料库,并人工标注其相似程度,同时采用了最初为不同但相似任务开发的另外两个语料库。我们的评估表明,在二分类相似度设定下,TabSim 平均以约 7 个百分点 F1 值优于其他表格相似度度量;在排序场景下平均以约 1.5 个百分点占优。

关键词

引用

@article{arxiv.2008.10856,
  title  = {TabSim: A Siamese Neural Network for Accurate Estimation of Table Similarity},
  author = {Maryam Habibi and Johannes Starlinger and Ulf Leser},
  journal= {arXiv preprint arXiv:2008.10856},
  year   = {2020}
}