中文

通过候选排序对假设生成系统进行大规模验证

信息检索 2018-12-07 v4 计算与语言

摘要

许多研究项目的第一步是定义并排序一份供研究的候选短列表。在当代科学进展的快速节奏下,一些人求助于自动化假设生成(HG)系统以辅助此过程。这些系统能够识别大型科学语料库中隐含或被忽视的联系,尽管其重要性随科学步伐俱增,却缺乏充分验证。在没有任何标准数值评估方法的情况下,许多通用HG系统通过重新发现少数历史发现来进行验证,而一些希望更为严谨者可能基于自动建议开展实验室实验。这些方法昂贵、耗时且无法扩展。因此,我们提出一个用于验证HG系统的数值评估框架,其利用数千个验证假设。该方法依据系统按可信度对假设排序的能力来评估HG系统;这一过程类似于人工候选筛选。由于HG系统不产生排序准则,特别是那些产生主题模型的系统,我们额外提出新指标,以量化给定主题模型系统输出的假设的可信度。最后,我们通过在近期主题驱动的HG系统Moliere中部署所提方法,自动生成一组与HIV相关神经退行性疾病(HAND)相关的候选基因,证明了我们的验证方法与真实世界研究目标一致。基于该候选集开展实验室实验,我们发现了HAND与Dead Box RNA Helicase 3(DDX3)之间的新联系。可复现性:代码、验证数据与结果见 sybrandt.com/2018/validation。

关键词

引用

@article{arxiv.1802.03793,
  title  = {Large-Scale Validation of Hypothesis Generation Systems via Candidate Ranking},
  author = {Justin Sybrandt and Michael Shtutman and Ilya Safro},
  journal= {arXiv preprint arXiv:1802.03793},
  year   = {2018}
}