少样本对话式稠密检索
信息检索
2021-05-20 v3
摘要
稠密检索(DR)有潜力通过在学习嵌入空间中匹配来解决对话搜索中的查询理解挑战。然而,这一适配具有挑战性,原因在于 DR 模型对监督信号的额外需求以及对话搜索的长尾特性。本文中,我们提出一个对话式稠密检索系统 ConvDR,其为多轮对话查询学习上下文嵌入,并仅使用嵌入点积检索文档。此外,我们利用师生框架赋予 ConvDR 少样本能力,其中采用即席稠密检索器作为教师,继承其文档编码,并学习学生查询编码器以在 oracle 重构查询上模仿教师嵌入。我们在 TREC CAsT 与 OR-QuAC 上的实验证明了 ConvDR 在少样本与全监督设置下的有效性。它优于此前在稀疏词空间中运行的系统,匹配了 oracle 查询重构的检索精度,并且因其简洁性而更高效。我们的分析揭示,ConvDR 的优势源于其捕获信息性上下文而忽略先前对话轮次中不相关上下文的能力。这使得 ConvDR 随着对话推进更为有效,而先前系统可能被来自前序轮次增加的噪声所混淆。我们的代码公开于 https://github.com/thunlp/ConvDR。
引用
@article{arxiv.2105.04166,
title = {Few-Shot Conversational Dense Retrieval},
author = {Shi Yu and Zhenghao Liu and Chenyan Xiong and Tao Feng and Zhiyuan Liu},
journal= {arXiv preprint arXiv:2105.04166},
year = {2021}
}
备注
Accepted by SIGIR 2021