中文

通过填补词汇与词频鸿沟实现稀疏检索的无监督域适应

计算与语言 2022-11-11 v1 信息检索

摘要

使用预训练语言模型的 IR(信息检索)模型显著优于 BM25 等词法方法。特别是,将文本编码为稀疏向量的 SPLADE 因其对域外数据集的鲁棒性而是一种实用的有效模型。然而,SPLADE 仍难以精确匹配训练数据中的低频词。此外,词汇与词频上的域偏移会恶化 SPLADE 的 IR 性能。由于目标域中监督数据稀缺,无需监督数据来解决域偏移是必要的。本文提出一种通过填补词汇与词频鸿沟的无监督域适应方法。首先,我们扩展词汇表并在目标域语料上用掩码语言模型执行持续预训练。然后,我们将 SPLADE 编码的稀疏向量乘以逆文档频率权重,以考虑含低频词的文档的重要性。我们在与源域存在大词汇鸿沟的数据集上用我们的方法进行了实验。我们表明我们的方法优于当前最先进的域适应方法。此外,我们的方法与 BM25 结合取得了最先进的结果。

关键词

引用

@article{arxiv.2211.03988,
  title  = {Unsupervised Domain Adaptation for Sparse Retrieval by Filling Vocabulary and Word Frequency Gaps},
  author = {Hiroki Iida and Naoaki Okazaki},
  journal= {arXiv preprint arXiv:2211.03988},
  year   = {2022}
}

备注

AACL-IJCNLP2022 Camera Ready