LADER:用于生物医学文献检索的日志增强稠密检索
信息检索
2024-02-16 v1 计算与语言
摘要
具有相似信息需求的查询往往具有相似的文档点击,尤其在生物医学文献搜索引擎中,查询通常较短且头部文档占据了总点击的大部分。受此启发,我们提出了一种用于生物医学文献检索的新架构,即日志增强稠密检索(Log-Augmented DEnse Retrieval, LADER),它是一个简单的插件模块,利用从相似训练查询中检索到的点击日志来增强稠密检索器。具体而言,LADER通过稠密检索器找到与给定查询相似的文档和查询。然后,LADER对相似查询的相关(被点击)文档按其与输入查询的相似度加权打分。LADER的最终文档得分为(1)来自稠密检索器的文档相似度得分与(2)来自相似查询点击日志的聚合文档得分的平均值。尽管简单,LADER在近期发布的生物医学文献检索基准TripClick上取得了新的最先进(SOTA)性能。在高频(HEAD)查询上,LADER相对NDCG@10比最佳检索模型大幅高出39%(0.338 对比 0.243)。LADER在较低频(TORSO)查询上也取得更好性能,相对NDCG@10较先前SOTA提升11%(0.303 对比 0.272)。在相似查询稀少的罕见(TAIL)查询上,LADER仍优于先前SOTA方法(NDCG@10:0.310 对比 0.295)。在所有查询上,LADER可在无需额外训练的情况下将稠密检索器的性能相对NDCG@10提升24%–37%,且更多日志有望带来进一步提升。我们的回归分析表明,更频繁、查询相似度熵更高且文档相似度熵更低的查询往往从日志增强中获益更多。
引用
@article{arxiv.2304.04590,
title = {LADER: Log-Augmented DEnse Retrieval for Biomedical Literature Search},
author = {Qiao Jin and Ashley Shin and Zhiyong Lu},
journal= {arXiv preprint arXiv:2304.04590},
year = {2024}
}
备注
SIGIR 2023