中文

MILL:基于大语言模型互验证的零样本查询扩展方法

信息检索 2024-03-29 v3 人工智能 计算与语言

摘要

查询扩展在搜索引擎中至关重要,它通过附加词项来增强用户的信息需求表示。现有方法利用检索或生成的上下文文档来扩展查询,但每种方法均有明显局限。基于检索的方法往往无法准确捕捉搜索意图,尤其在处理简短或模糊查询时。基于生成的方法利用大语言模型(LLMs)通常缺乏语料库特定知识,且微调成本高昂。为弥补这些不足,我们提出了一种新颖的零样本查询扩展框架,利用LLMs进行互验证。具体而言,我们首先设计了一种查询-查询-文档生成方法,借助LLMs的零样本推理能力生成多样化的子查询及对应文档。随后,互验证过程协同生成的文档与检索到的文档以实现最优扩展。我们提出的方法完全零样本,并在三个公开基准数据集上进行了大量实验以证明相对于现有方法的有效性。我们的代码发布于 https://github.com/Applied-Machine-Learning-Lab/MILL 以便于复现。

关键词

引用

@article{arxiv.2310.19056,
  title  = {MILL: Mutual Verification with Large Language Models for Zero-Shot Query Expansion},
  author = {Pengyue Jia and Yiding Liu and Xiangyu Zhao and Xiaopeng Li and Changying Hao and Shuaiqiang Wang and Dawei Yin},
  journal= {arXiv preprint arXiv:2310.19056},
  year   = {2024}
}

备注

Accepted to NAACL 2024