解码神经检索器潜在空间以进行查询建议
计算与语言
2022-10-24 v1 人工智能
机器学习
摘要
神经检索模型已取代 BM25 等经典词袋方法,成为首选的检索框架。然而,神经系统缺乏词袋模型的可解释性;将查询变更与其最终决定检索结果的潜在空间中的变更联系起来并非易事。为阐明这一嵌入空间,我们学习了一个“查询解码器”,该解码器在给定神经搜索引擎的潜在表示时生成相应查询。我们表明,从其潜在表示中解码出有意义的查询是可能的,并且在潜在空间中沿正确方向移动时,可解码出能检索相关段落的查询。特别地,查询解码器可用于理解“本应查询什么”才能从集合中检索出特定段落。我们利用查询解码器为 MSMarco 生成大规模合成查询重构数据集,从而提升了检索性能。在该数据上,我们训练了一个伪相关反馈(PRF)T5 模型用于查询建议应用,其性能优于查询重构与 PRF 信息检索基线。
引用
@article{arxiv.2210.12084,
title = {Decoding a Neural Retriever's Latent Space for Query Suggestion},
author = {Leonard Adolphs and Michelle Chen Huebscher and Christian Buck and Sertan Girgin and Olivier Bachem and Massimiliano Ciaramita and Thomas Hofmann},
journal= {arXiv preprint arXiv:2210.12084},
year = {2022}
}