通过填补词汇与词频鸿沟实现稀疏检索的无监督域适应
计算与语言
2022-11-11 v1 信息检索
摘要
使用预训练语言模型的 IR(信息检索)模型显著优于 BM25 等词法方法。特别是,将文本编码为稀疏向量的 SPLADE 因其对域外数据集的鲁棒性而是一种实用的有效模型。然而,SPLADE 仍难以精确匹配训练数据中的低频词。此外,词汇与词频上的域偏移会恶化 SPLADE 的 IR 性能。由于目标域中监督数据稀缺,无需监督数据来解决域偏移是必要的。本文提出一种通过填补词汇与词频鸿沟的无监督域适应方法。首先,我们扩展词汇表并在目标域语料上用掩码语言模型执行持续预训练。然后,我们将 SPLADE 编码的稀疏向量乘以逆文档频率权重,以考虑含低频词的文档的重要性。我们在与源域存在大词汇鸿沟的数据集上用我们的方法进行了实验。我们表明我们的方法优于当前最先进的域适应方法。此外,我们的方法与 BM25 结合取得了最先进的结果。
引用
@article{arxiv.2211.03988,
title = {Unsupervised Domain Adaptation for Sparse Retrieval by Filling Vocabulary and Word Frequency Gaps},
author = {Hiroki Iida and Naoaki Okazaki},
journal= {arXiv preprint arXiv:2211.03988},
year = {2022}
}
备注
AACL-IJCNLP2022 Camera Ready