有限监督下的对话搜索查询解析
信息检索
2020-05-26 v1 计算与语言
摘要
本工作聚焦于作为对话搜索关键组成部分的多轮段落检索。多轮段落检索的一个关键挑战在于,由于零指代、话题转换或话题回指,当前轮次的查询往往表述不够明确。可以利用对话历史中的上下文来获得当前轮次查询的更好表达,这一任务被定义为查询解析。在本文中,我们将查询解析任务建模为一个二值词项分类问题:对于对话前几轮中出现的每个词项,决定是否将其添加到当前轮次的查询中。我们提出了 QuReTeC(基于词项分类的查询解析),一种基于双向 Transformer 的神经查询解析模型。我们提出了一种远程监督方法,通过利用查询-段落相关性标签来自动生成训练数据。这类标签通常在数据集中容易获得,无论是人工标注还是从用户交互中推断得到。我们展示了 QuReTeC 优于现有最优模型,并且进一步表明,我们的远程监督方法可用于大幅减少训练 QuReTeC 所需的人工标注数据量。我们将 QuReTeC 集成到一个多轮、多阶段的段落检索架构中,并在 TREC CAsT 数据集上证明了其有效性。
引用
@article{arxiv.2005.11723,
title = {Query Resolution for Conversational Search with Limited Supervision},
author = {Nikos Voskarides and Dan Li and Pengjie Ren and Evangelos Kanoulas and Maarten de Rijke},
journal= {arXiv preprint arXiv:2005.11723},
year = {2020}
}
备注
SIGIR 2020 full conference paper