MASTER:多任务预训练瓶颈式掩码自编码器是更优的稠密检索器
计算与语言
2023-06-21 v2 信息检索
摘要
预训练的 Transformers(如 BERT)已常用于现有稠密检索方法中以初始化参数,近期研究正在探索更有效的预训练任务以进一步提升稠密向量的质量。尽管已提出各种新颖且有效的任务,它们不同的输入格式和学习目标使其难以被整合以联合提升模型性能。本工作中,我们旨在将多种预训练任务统一为瓶颈式掩码自编码器形式,并将其整合为一个多任务预训练模型,即 MASTER。具体而言,MASTER 采用共享编码器-多解码器架构,可构建表征瓶颈,将跨任务的丰富语义信息压缩为稠密向量。在此基础上,我们整合了三类代表性预训练任务:受损段落恢复、相关段落恢复和 PLM 输出恢复,以刻画段落内信息、段落间关系及 PLM 知识。大量实验表明,我们的方法优于具有竞争力的稠密检索方法。我们的代码与数据已公开发布于 \url{https://github.com/microsoft/SimXNS}。
引用
@article{arxiv.2212.07841,
title = {MASTER: Multi-task Pre-trained Bottlenecked Masked Autoencoders are Better Dense Retrievers},
author = {Kun Zhou and Xiao Liu and Yeyun Gong and Wayne Xin Zhao and Daxin Jiang and Nan Duan and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2212.07841},
year = {2023}
}
备注
Accepted by ECML-PKDD 2023, 16 pages