通过零样本生成改进生成与检索知识的组合
计算与语言
2024-12-30 v1
摘要
域内问答(QA)通过结合忠实检索段落和通过大语言模型(LLM)生成的相关段落的优势而引起广泛关注。然而,缺乏可用于匹配这些知识来源的明确标签。为解决此问题,我们提出了一种无监督且简单的方法——称为 BRMGR(Bi-Reranking for Merging Generated and Retrieved Knowledge)的框架,该框架利用对检索段落和LLM生成段落进行重新排序。我们使用两种独立的重新排序方法匹配这两种类型的段落,然后通过贪婪匹配将其组合。我们展示,BRMGR 等价于在为每个检索段落分配对应的LLM生成段落时采用二分匹配损失。本模型的应用实验结果显示,在NQ 和 WebQ 数据集上分别提高了 +1.7 和 +1.6 的性能,在与竞争性基线进行比较时,TriviaQA 数据集获得了相当的结果。
引用
@article{arxiv.2412.18800,
title = {Improving Generated and Retrieved Knowledge Combination Through Zero-shot Generation},
author = {Xinkai Du and Quanjie Han and Chao Lv and Yan Liu and Yalin Sun and Hao Shu and Hongbo Shan and Maosong Sun},
journal= {arXiv preprint arXiv:2412.18800},
year = {2024}
}
备注
Accepted by ICASSP 2025