中文

EmbNum:基于深度度量学习的数值语义标注

数据库 2018-08-17 v2 机器学习 机器学习

摘要

数值的语义标注是为未知数值属性分配语义标签的任务。语义标签可以是本体中的数值属性、知识库中的实例,或由领域专家手动标注的数据。在本文中,我们将语义标注视为一种检索设定:未知属性的标签由标注数据中相关性最强属性的标签所赋予。最大的挑战之一是,未知属性很少与标注数据中的相似属性具有相同的取值集合。为克服该问题,需考虑取值分布的统计解释。然而,现有研究假设了特定的分布形式。在事先无数据知识的开放数据场景下,这种做法尤其不合适。为解决这些问题,我们提出一种神经数值嵌入模型(EmbNum),在无需对数据分布作先验假设的情况下,为数值属性学习有用的表示向量。随后,在这些表示向量上以欧氏距离度量属性间的“语义相似度”。我们在 City Data 和 Open Data 上的实证实验表明,在数值属性语义标注任务的有效性与效率方面,EmbNum 显著优于 SOTA 方法。

关键词

引用

@article{arxiv.1807.01367,
  title  = {EmbNum: Semantic labeling for numerical values with deep metric learning},
  author = {Phuc Nguyen and Khai Nguyen and Ryutaro Ichise and Hideaki Takeda},
  journal= {arXiv preprint arXiv:1807.01367},
  year   = {2018}
}

备注

16 pages