中文

连续空间中的端到端检索

信息检索 2018-11-21 v1 计算与语言 机器学习

摘要

大多数基于文本的信息检索(IR)系统通过词或短语来索引对象。这些离散系统已被使用嵌入在连续空间中度量相似度的模型所增强。但连续空间模型通常仅用于对候选 top 结果重新排序。我们考虑端到端连续检索问题,其中标准近似最近邻(ANN)搜索取代通常的离散倒排索引,并完全依赖于学习到的嵌入之间的距离。通过专门针对检索任务训练简单模型,并采用适当的模型架构,我们在两个相似问题检索任务上相较离散基线分别提升了 8% 和 26%(MAP)。我们还讨论了检索系统评估的问题,并展示了如何为此目的修改现有的成对相似度数据集。

关键词

引用

@article{arxiv.1811.08008,
  title  = {End-to-End Retrieval in Continuous Space},
  author = {Daniel Gillick and Alessandro Presta and Gaurav Singh Tomar},
  journal= {arXiv preprint arXiv:1811.08008},
  year   = {2018}
}