中文

面向垂直搜索的领域特定预训练:以生物医学文献为例

信息检索 2021-09-20 v2 计算与语言 数字图书馆

摘要

信息过载是许多高价值领域中的普遍挑战。一个突出的例子是COVID-19相关生物医学文献的爆发,其在短短几个月内激增至数十万篇论文。一般而言,生物医学文献每分钟增加两篇,每年总计超过一百万篇新论文。由于来自点击日志的直接监督稀缺,生物医学领域及许多其他垂直领域的搜索具有挑战性。自监督学习已成为克服标注瓶颈的一个有前景的方向。我们提出了一种基于领域特定预训练的通用垂直搜索方法,并给出了生物医学领域的一个案例研究。尽管我们的方法明显更简单且未使用任何相关性标签进行训练或开发,但其在官方TREC-COVID评估(一项COVID相关生物医学搜索竞赛)中的表现与最佳系统相当或更好。利用现代云基础设施中的分布式计算,我们的系统可扩展至PubMed上数千万篇文章,并已部署为Microsoft Biomedical Search,一种全新的生物医学文献搜索体验:https://aka.ms/biomedsearch。

关键词

引用

@article{arxiv.2106.13375,
  title  = {Domain-Specific Pretraining for Vertical Search: Case Study on Biomedical Literature},
  author = {Yu Wang and Jinchao Li and Tristan Naumann and Chenyan Xiong and Hao Cheng and Robert Tinn and Cliff Wong and Naoto Usuyama and Richard Rogahn and Zhihong Shen and Yang Qin and Eric Horvitz and Paul N. Bennett and Jianfeng Gao and Hoifung Poon},
  journal= {arXiv preprint arXiv:2106.13375},
  year   = {2021}
}

备注

ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD) 2021 Applied Data Science Track