中文

基于对比反馈的无监督大语言模型对齐用于信息检索

信息检索 2024-03-27 v2

摘要

大语言模型(LLMs)已在包括信息检索(IR)领域在内的多个研究领域中展现出卓越能力。然而,现成 LLMs 生成的回复往往较为泛化,即无法捕捉具有相似内容的各文档的独特性。这限制了 LLMs 在 IR 中的性能,因为从大量相似文档中查找并区分相关文档是许多 IR 任务中的典型问题。为解决此问题,我们提出了一种无监督对齐方法,即对比反馈强化学习(RLCF),使 LLMs 能够生成高质量且特定于上下文的回复。我们的方法基于相似文档组构建无监督对比反馈信号,并采用一种名为组间倒数排名的奖励函数,在标准近端策略优化中优化 LLMs。我们进行了大量实验,以评估 RLCF 在不同语言和参数规模的 LLMs 上以及多个下游 IR 应用中的有效性。RLCF 显著优于现有对齐方法,且经 RLCF 优化的 LLMs 在生成具有独特性的回复方面表现出可观改进。

关键词

引用

@article{arxiv.2309.17078,
  title  = {Unsupervised Large Language Model Alignment for Information Retrieval via Contrastive Feedback},
  author = {Qian Dong and Yiding Liu and Qingyao Ai and Zhijing Wu and Haitao Li and Yiqun Liu and Shuaiqiang Wang and Dawei Yin and Shaoping Ma},
  journal= {arXiv preprint arXiv:2309.17078},
  year   = {2024}
}

备注

Accepted by SIGIR24