中文

面向神经信息检索的无监督域自适应

计算与语言 2023-10-17 v1 人工智能

摘要

神经信息检索需要为每个目标域标注昂贵的数据才能具有竞争力。利用大语言模型(LLM)或基于规则的字符串操作进行查询生成以合成标注已被提出作为替代方案,但二者的相对优劣尚未被分析。本文中,我们使用相同的神经 IR 架构对两种方法进行了正面比较。我们聚焦于 BEIR 基准,其包含来自多个无训练数据域的测试数据集,并探索两种场景:零样本,即监督系统在大型域外数据集(MS-MARCO)上训练;以及无监督域自适应,即除 MS-MARCO 外,系统在来自目标域的合成数据上微调。我们的结果表明,在所有场景中 LLM 都以较大优势优于基于规则的方法,且更重要的是,与以零样本方式应用监督 IR 系统相比,无监督域自适应是有效的。此外,我们探索了多种规模的开放大语言模型来生成合成数据,发现中等规模模型已足够。代码与模型已公开以供复现。

关键词

引用

@article{arxiv.2310.09350,
  title  = {Unsupervised Domain Adaption for Neural Information Retrieval},
  author = {Carlos Dominguez and Jon Ander Campos and Eneko Agirre and Gorka Azkune},
  journal= {arXiv preprint arXiv:2310.09350},
  year   = {2023}
}