RetroMAE:基于掩码自编码器的检索导向语言模型预训练
计算与语言
2022-10-18 v2
摘要
尽管预训练在许多重要的自然语言处理(NLP)任务中取得了进展,但针对稠密检索的有效预训练策略仍有待探索。本文提出 RetroMAE,一种基于掩码自编码器(MAE)的新的检索导向预训练范式。RetroMAE 的三个关键设计尤为突出。1)一种新颖的 MAE 工作流程,其中输入句子以不同的掩码对编码器和解码器进行污染。句子嵌入由编码器的掩码输入生成;然后,基于句子嵌入与解码器的掩码输入,通过掩码语言建模恢复原始句子。2)非对称模型结构,采用类 BERT 的完整规模 transformer 作为编码器,单层 transformer 作为解码器。3)非对称掩码比例,编码器采用适中比例:15~30%,解码器采用激进比例:50~70%。我们的框架易于实现且在经验上具竞争力:预训练模型显著提升了 BEIR 和 MS MARCO 等广泛稠密检索基准上的 SOTA 性能。源代码与预训练模型已公开于 https://github.com/staoxiao/RetroMAE,以启发更多有趣的研究。
引用
@article{arxiv.2205.12035,
title = {RetroMAE: Pre-Training Retrieval-oriented Language Models Via Masked Auto-Encoder},
author = {Shitao Xiao and Zheng Liu and Yingxia Shao and Zhao Cao},
journal= {arXiv preprint arXiv:2205.12035},
year = {2022}
}
备注
Accepted to EMNLP 2022