中文

LexMAE:面向大规模检索的词典瓶颈预训练

信息检索 2023-06-06 v2

摘要

在大规模检索中,词典加权范式——在词表空间中学习加权稀疏表示——已展现出高质量与低延迟的良好前景。尽管其深度利用了预训练语言模型的词典表征能力,语言建模与词典加权检索之间仍存在关键鸿沟:前者偏好确定或低熵词,而后者青睐枢纽或高熵词——这成为大规模检索中词典加权性能的主要障碍。为弥合此鸿沟,我们提出一种全新预训练框架,即词典瓶颈掩码自编码器(LexMAE),以学习感知重要性的词典表示。本质上,我们在常规语言建模编码器与弱化解码器之间引入词典瓶颈模块,其中构建连续词袋瓶颈以无监督方式学习词典重要性分布。预训练的 LexMAE 可通过微调便捷迁移至词典加权检索。在 ad-hoc 检索基准 MS-Marco 上,于 CPU 机器上段落数据集取得 42.6% MRR@10 与 45.8 QPS,文档数据集取得 44.4% MRR@100 与 134.8 QPS。且 LexMAE 在 BEIR 基准的 12 个数据集上展现出最先进的零样本迁移能力。

关键词

引用

@article{arxiv.2208.14754,
  title  = {LexMAE: Lexicon-Bottlenecked Pretraining for Large-Scale Retrieval},
  author = {Tao Shen and Xiubo Geng and Chongyang Tao and Can Xu and Xiaolong Huang and Binxing Jiao and Linjun Yang and Daxin Jiang},
  journal= {arXiv preprint arXiv:2208.14754},
  year   = {2023}
}

备注

Appeared at ICLR 2023