DrugDBEmbed:基于有监督列编码的关系数据库语义查询
数据库
2020-07-07 v1
摘要
传统关系数据库包含大量潜在的语义信息,由于自动提取此类信息的困难,这些信息在很大程度上未被发掘。近期工作提出了无监督机器学习方法,通过将数据库列文本化并将文本词元投影到固定维语义向量空间来提取此类隐藏信息。然而,在某些数据库中,可能提供特定任务的类标签,而无监督方法无法以原则性方式利用这些标签。此外,当在词元级别生成嵌入时,对于任意给定行,多词元文本列的列编码必须通过取该列中存在的词元向量平均值来计算。正如自然语言处理领域中对段落或文档编码时所观察到的,此类平均方法可能无法产生多词元文本列的最佳语义向量表示。考虑到这些缺陷,我们提出一种有监督机器学习方法,使用基于 Bi-LSTM 的序列编码器直接为 DrugBank 数据库的多词元文本列生成列编码,该数据库包含金标准药物-药物交互(DDI)标签。我们数据驱动的文本编码方法在某些列的监督 DDI 预测任务上实现了很高的准确率,并且我们使用那些有监督列编码来模拟和评估关系数据上的类比 SQL 查询,以证明我们技术的有效性。
引用
@article{arxiv.2007.02384,
title = {DrugDBEmbed : Semantic Queries on Relational Database using Supervised Column Encodings},
author = {Bortik Bandyopadhyay and Pranav Maneriker and Vedang Patel and Saumya Yashmohini Sahai and Ping Zhang and Srinivasan Parthasarathy},
journal= {arXiv preprint arXiv:2007.02384},
year = {2020}
}