提升用户搜索生物医学研究数据集的平均排序精度
信息检索
2017-09-12 v1
摘要
研究数据集的可获得性是健康与生命科学研究可重复性和科学进步的关键。由于这些数据的异质性和复杂性,研究数据管理系统需要克服的一个主要挑战是为用户的搜索查询提供最佳答案。在 2016 年 bioCADDIE 数据集检索挑战赛背景下,我们研究了一种新颖的排序流水线,以改进生物医学实验中使用的数据集的搜索。我们的系统包含基于词嵌入的查询扩展模型、考虑查询词相关性的相似度度量算法,以及提升匹配查询约束的数据集排名的数据集分类方法。该系统使用包含 80 万数据集和 21 条带标注用户查询的语料库进行评估。与其他挑战赛参与者相比,我们的系统提供了具有竞争力的结果。在官方运行中,它实现了参与者中最高的 infAP,比参与者最佳提交的中位 infAP 高 +22.3%。总体而言,若考虑使用每位参与者最佳官方指标的聚合度量,它排名前 2。查询扩展方法对系统性能显示出积极影响,使我们的基线在 infAP 和 infNDCG 指标上分别提升高达 +5.0% 和 +3.4%。我们的相似度度量算法似乎是鲁棒的,特别是与 Divergence From Randomness 框架相比,在不同训练条件下性能波动更小。最后,结果分类对系统性能没有显著影响。我们相信我们的解决方案可用于增强生物医学数据集管理系统。特别是,使用数据驱动的查询扩展方法可以成为生物医学术语复杂性的一种替代方案。
引用
@article{arxiv.1709.03061,
title = {Improving average ranking precision in user searches for biomedical research datasets},
author = {Douglas Teodoro and Luc Mottin and Julien Gobeill and Arnaud Gaudinat and Thérèse Vachon and Patrick Ruch},
journal= {arXiv preprint arXiv:1709.03061},
year = {2017}
}