丢弃解码器:基于词袋预测的稠密段落检索预训练
信息检索
2024-04-23 v2 计算与语言
摘要
掩码自编码器预训练已成为初始化和增强稠密检索系统的一种主流技术。它通常利用额外的 Transformer 解码器块来提供持续的训练监督信号,并将上下文信息压缩为稠密表示。然而,这种预训练技术有效的潜在原因尚不清楚。使用额外的基于 Transformer 的解码器也会带来巨大的计算成本。在本研究中,我们旨在阐明这一问题:与原始 BERT 检查点相比,具有增强解码的掩码自编码器 (MAE) 预训练显著提高了稠密表示中输入 token 的词项覆盖率。基于这一观察,我们提出对传统 MAE 进行修改,将掩码自编码器的解码器替换为完全简化的词袋预测任务。这种修改使得通过无监督预训练能够将词汇信号高效地压缩为稠密表示。值得注意的是,我们提出的方法在不需要任何额外参数的情况下,在多个大规模检索基准上取得了 SOTA 的检索性能,与具有增强解码的标准掩码自编码器预训练相比,训练速度提升了 67%。
引用
@article{arxiv.2401.11248,
title = {Drop your Decoder: Pre-training with Bag-of-Word Prediction for Dense Passage Retrieval},
author = {Guangyuan Ma and Xing Wu and Zijia Lin and Songlin Hu},
journal= {arXiv preprint arXiv:2401.11248},
year = {2024}
}
备注
Accepted by SIGIR24. Our code is available at https://github.com/ma787639046/bowdpr