中文

本体对齐:一种基于内容的贝叶斯方法

数据库 2019-08-27 v1 信息检索 机器学习

摘要

存在许多由不同组织维护的遗留数据库及相关信息存储,而其他组织希望访问并使用这些异构数据源。当前受关注的例子包括急诊室记录(用于追踪与拦截非法药物)或表明大规模枪击事件准备与意图的社交媒体公开帖子。多数情况下,这些信息被发现时已来不及发挥作用。尽管负责协调的机构意识到即时访问新数据的潜在价值,但建立连接的代价令人望而却步。随着“标签化”的泛滥,新标签与本体关系可在一夜之间涌现,问题更趋严峻。尽管研究兴趣减退,对强大且廉价、能快速访问多源数据的工具之需求却愈发迫切。本文描述了利用贝叶斯本体对齐工具(Bayesian Ontology Alignment tool, BOA)计算对齐矩阵系数的技术,该系数将一个数据库的字段或内容与另一数据库的相应部分关联起来。特别地,当数据源所有含某小集合取值的单元格时,我们关注具有易于理解含义的公式。这些公式可用概率估计表示。估计本身由“黑盒”多分类逻辑回归模型(polytomous logistic regression model, PLRM)给出,故可轻易推广至任意概率生成模型的情形。本例中所用的特定 PLRM 模型为 BOXER 贝叶斯可扩展在线回归模型。

关键词

引用

@article{arxiv.1908.09205,
  title  = {Ontology alignment: A Content-Based Bayesian Approach},
  author = {Vladimir Menkov and Paul Kantor},
  journal= {arXiv preprint arXiv:1908.09205},
  year   = {2019}
}

备注

29 pp. 2 figure. Research Technical Report