为 TripClick 健康检索建立强基线
信息检索
2022-01-04 v1 计算与语言
摘要
我们为近期发布的 TripClick 健康特设检索集合提供了基于 Transformer 的强重排序与稠密检索基线。我们通过简单的负采样策略改进了原本过于嘈杂的训练数据。在 TripClick 的重排序任务中,我们相较 BM25 取得了大幅提升,而原始基线未能实现此类提升。此外,我们研究了不同领域特定预训练模型对 TripClick 的影响。最后,我们表明即便采用简单训练流程,稠密检索仍以可观的幅度优于 BM25。
引用
@article{arxiv.2201.00365,
title = {Establishing Strong Baselines for TripClick Health Retrieval},
author = {Sebastian Hofstätter and Sophia Althammer and Mete Sertkan and Allan Hanbury},
journal= {arXiv preprint arXiv:2201.00365},
year = {2022}
}
备注
Accepted at ECIR 2022