中文

CoT-MoTE:探索基于文本专家混合的上下文掩码自编码器预训练用于段落检索

计算与语言 2023-04-21 v1 信息检索

摘要

段落检索旨在从开放域语料库的大规模集合中检索相关段落。上下文掩码自编码已被证明在用于段落检索的整体式双编码器的表示瓶颈预训练中是有效的。在预训练和微调阶段,常采用孪生或完全分离的双编码器作为基本检索架构,用于将查询和段落编码到其潜在嵌入空间中。然而,简单地共享或分离双编码器的参数会导致嵌入空间的判别不平衡。在本工作中,我们提出使用文本专家混合(Mixture-of-Textual-Experts)预训练上下文掩码自编码器(CoT-MoTE)。具体而言,我们引入文本专用专家,分别编码查询和段落的不同属性。同时,仍保留共享的自注意力层以进行统一的注意力建模。在大规模段落检索基准上的结果表明检索性能有稳定提升。定量分析也显示出对潜在嵌入空间更平衡的判别。

关键词

引用

@article{arxiv.2304.10195,
  title  = {CoT-MoTE: Exploring ConTextual Masked Auto-Encoder Pre-training with Mixture-of-Textual-Experts for Passage Retrieval},
  author = {Guangyuan Ma and Xing Wu and Peng Wang and Songlin Hu},
  journal= {arXiv preprint arXiv:2304.10195},
  year   = {2023}
}