中文

通过指令微调的无监督文本表示学习用于零样本密集检索

人工智能 2024-09-26 v1

摘要

密集检索系统通常用于信息检索 (IR)。它们依赖于通过编码器学习文本表示,并且通常需要通过带标签的数据进行监督建模,而这些数据获取成本高昂或根本无法获取。在本研究中,我们引入了一种新颖的无监督文本表示学习技术,通过在双编码器检索框架下对预训练的编码器-解码器大语言模型 (LLM) 进行指令微调来实现。我们证明了基于 Rao-Blackwell 定理,语料库表示可以通过由指令微调后的 LLM 生成的相关合成查询的表示来增强。此外,我们通过自我指令微调有效地对齐了查询和语料库的文本表示。具体而言,我们首先提示一个开箱即用的预训练 LLM 遵循定义的指令(即问题生成和关键词摘要)来生成合成查询。接下来,我们使用定义的指令和通过质量检查的生成查询来微调预训练 LLM。最后,我们使用指令微调后的 LLM 为每个语料库生成合成查询,并通过加权平均合成查询与原始语料库嵌入来表示每个语料库。我们在低资源设置下,在三个英语和一个德语检索数据集上评估了所提出的方法,衡量指标为 NDCG@10、MRR@100、Recall@100。我们在所有指标上显著提高了平均零样本检索性能,使开箱即用的 FLAN-T5 模型变体绝对提升了 [3.34%, 3.50%],并在模型尺寸至少小 38% 的情况下,在 NDCG@10 上绝对超越三个有竞争力的密集检索器(即 mDPR、T-Systems、mBART-Large)1.96%、4.62%、9.52%。

关键词

引用

@article{arxiv.2409.16497,
  title  = {Unsupervised Text Representation Learning via Instruction-Tuning for Zero-Shot Dense Retrieval},
  author = {Qiuhai Zeng and Zimeng Qiu and Dae Yon Hwang and Xin He and William M. Campbell},
  journal= {arXiv preprint arXiv:2409.16497},
  year   = {2024}
}

备注

Accepted at DCAI24 workshop@CIKM2024