中文

CoT-MAE v2:用于段落检索的带多视图建模的上下文掩码自编码器

计算与语言 2023-04-07 v1 人工智能 信息检索 机器学习

摘要

越来越多技术涌现以提升段落检索性能。作为有效的表示瓶颈预训练技术,上下文掩码自编码器利用上下文嵌入辅助段落重建。然而,它仅使用单一自编码预任务进行稠密表示预训练。本研究将多视图建模引入上下文掩码自编码器。首先,多视图表示同时利用稠密与稀疏向量作为多视图表示,旨在从不同方面捕获句子语义。此外,多视图解码范式在表示瓶颈预训练中同时使用自编码与自回归解码器,旨在为更好的上下文表示预训练提供重建与生成双重信号。我们将此多视图预训练方法称为 CoT-MAE v2。通过大量实验,我们表明 CoT-MAE v2 在大规模段落检索基准与域外零样本基准上均有效且鲁棒。

关键词

引用

@article{arxiv.2304.03158,
  title  = {CoT-MAE v2: Contextual Masked Auto-Encoder with Multi-view Modeling for Passage Retrieval},
  author = {Xing Wu and Guangyuan Ma and Peng Wang and Meng Lin and Zijia Lin and Fuzheng Zhang and Songlin Hu},
  journal= {arXiv preprint arXiv:2304.03158},
  year   = {2023}
}

备注

working in progress