中文

Distill-VQ:通过从稠密嵌入中蒸馏知识来学习面向检索的向量量化

信息检索 2022-04-29 v2 人工智能

摘要

基于向量量化(VQ)的近似最近邻(ANN)索引,如倒排文件系统(IVF)和产品量化(PQ),因其具有竞争力的时空效率而被广泛应用于基于嵌入的文档检索。最初,VQ 的学习目标是最小化重构损失,即量化前的原始稠密嵌入与重构嵌入之间的失真。遗憾的是,该目标与为输入查询筛选真值文档的目标并不一致,可能导致检索质量的严重损失。近期工作指出了这一缺陷,并提出通过对比学习来最小化检索损失。然而,这些方法高度依赖带有真值文档的查询,其性能受限于标注数据的不足。本文提出 Distill-VQ,将 IVF 与 PQ 的学习统一于知识蒸馏框架之中。在 Distill-VQ 中,稠密嵌入被用作“教师”,预测查询与采样文档的相关性;VQ 模块被视为“学生”,被学习以复现所预测的相关性,从而使重构嵌入能够完整保留稠密嵌入的检索结果。借此,Distill-VQ 能够从海量无标注数据中获取充足的训练信号,显著提升检索质量。我们对知识蒸馏的最优实施进行了全面探索,可为基于 VQ 的 ANN 索引学习提供有益见解。实验还表明,标注数据已不再是高质量向量量化的必要条件,这说明 Distill-VQ 在实践中具有很强的适用性。

关键词

引用

@article{arxiv.2204.00185,
  title  = {Distill-VQ: Learning Retrieval Oriented Vector Quantization By Distilling Knowledge from Dense Embeddings},
  author = {Shitao Xiao and Zheng Liu and Weihao Han and Jianjin Zhang and Defu Lian and Yeyun Gong and Qi Chen and Fan Yang and Hao Sun and Yingxia Shao and Denvy Deng and Qi Zhang and Xing Xie},
  journal= {arXiv preprint arXiv:2204.00185},
  year   = {2022}
}

备注

Accepted by SIGIR 2022