通过可控查询生成提升搜索中的内容可检索性
信息检索
2023-03-22 v1 计算与语言
机器学习
摘要
在线平台的一个重要目标是实现内容发现,即允许用户找到其原本不熟悉的目录实体。用搜索引擎发现一个实体(例如一本书)的先决条件是该实体是可检索的,即存在某些查询能使系统将该实体展现在顶部结果中。然而,机器学习驱动的搜索引擎具有高度的可检索性偏差,其中大多数查询返回相同的实体。这部分是由于窄意图查询占主导,用户使用已知实体的标题来构造查询,例如在图书搜索中“harry potter”。相比之下,用户希望发现新实体的宽泛意图查询(例如在音乐搜索中“带有氛围感、舒缓抒情电子乐”)数量较少,且对可能找到的结果有更高容忍度。我们在此关注对实体可检索性有负面影响的两种因素:(I)用于稠密检索模型的训练数据,以及(II)系统中发出的窄意图与宽泛意图查询的分布。我们提出CtrlQGen,一种为选定底层意图(窄或宽)生成查询的方法。我们可以使用CtrlQGen通过生成由多样化合成查询组成的训练数据来改进因素(I)。CtrlQGen也可用于通过向用户建议更宽泛意图的查询来处理因素(II)。我们在音乐、播客与图书领域数据集上的结果表明,使用CtrlQGen可显著降低稠密检索模型的可检索性偏差。首先,通过将生成的查询用作稠密模型的训练数据,我们使9%的实体变得可检索(从零可检索性变为非零)。其次,通过向用户建议更宽泛的查询,我们在最佳情况下可使12%的实体变得可检索。
引用
@article{arxiv.2303.11648,
title = {Improving Content Retrievability in Search with Controllable Query Generation},
author = {Gustavo Penha and Enrico Palumbo and Maryam Aziz and Alice Wang and Hugues Bouchard},
journal= {arXiv preprint arXiv:2303.11648},
year = {2023}
}
备注
Accepted for publication in the International World Wide Web Conference 2023