连续空间中的端到端检索
信息检索
2018-11-21 v1 计算与语言
机器学习
摘要
大多数基于文本的信息检索(IR)系统通过词或短语来索引对象。这些离散系统已被使用嵌入在连续空间中度量相似度的模型所增强。但连续空间模型通常仅用于对候选 top 结果重新排序。我们考虑端到端连续检索问题,其中标准近似最近邻(ANN)搜索取代通常的离散倒排索引,并完全依赖于学习到的嵌入之间的距离。通过专门针对检索任务训练简单模型,并采用适当的模型架构,我们在两个相似问题检索任务上相较离散基线分别提升了 8% 和 26%(MAP)。我们还讨论了检索系统评估的问题,并展示了如何为此目的修改现有的成对相似度数据集。
引用
@article{arxiv.1811.08008,
title = {End-to-End Retrieval in Continuous Space},
author = {Daniel Gillick and Alessandro Presta and Gaurav Singh Tomar},
journal= {arXiv preprint arXiv:1811.08008},
year = {2018}
}