中文

扩展非自回归模型词汇表以提升生成式检索的效率

计算与语言 2024-06-12 v1 信息检索 机器学习

摘要

生成式检索通过将其重新建模为受约束的生成任务,引入了一种新的信息检索方法,借鉴了自回归(AR)语言模型的最新进展。然而,与传统稠密检索技术相比,基于AR的生成式检索方法在推理延迟和成本方面存在显著劣势,限制了其实际应用范围。本文探讨了完全非自回归(NAR)语言模型作为更高效生成式检索备选方案。虽然标准NAR模型缓解了延迟和成本问题,但由于无法捕捉目标标记之间的依赖关系,检索性能相较于AR模型出现显著下降。为此,我们质疑了将目标标记空间仅限于单词或子词的常规做法,提出PIXAR方法,通过将NAR模型的目标词汇扩展至包含多词实体和常见短语(最高达500万个标记),从而减少标记依赖关系。PIXAR采用推理优化策略,在显著扩大的词汇表下维持低推理延迟。实验结果表明,PIXAR在MS MARCO上实现MRR@10提升31.0%,在Natural Questions上实现Hits@5提升23.2%,且与标准NAR模型的延迟和成本相似。此外,线上A/B测试显示,PIXAR在大型商业搜索引擎上的广告点击量提升5.08%,收入提升4.02%。

关键词

引用

@article{arxiv.2406.06739,
  title  = {Scaling the Vocabulary of Non-autoregressive Models for Efficient Generative Retrieval},
  author = {Ravisri Valluri and Akash Kumar Mohankumar and Kushal Dave and Amit Singh and Jian Jiao and Manik Varma and Gaurav Sinha},
  journal= {arXiv preprint arXiv:2406.06739},
  year   = {2024}
}

备注

14 pages, 6 tables, 2 figures