中文

基于模型融合的稀缺数据上的 REFINE:通过微调提升检索

计算与语言 2024-10-18 v1 信息检索

摘要

检索增强生成(RAG)管道在问答(QA)等任务中广泛使用,依赖于从向量存储中检索相关文档,向量存储由预训练嵌入模型计算得出。然而,若检索的上下文不准确,基于大型语言模型(LLM)生成的答案可能包含错误或幻觉。尽管预训练嵌入模型已取得进展,但将其适应新领域仍具有挑战。微调是一种潜在解决方案,但工业环境往往缺乏必要的微调数据。为此,我们提出 REFINE,一种新型技术,通过生成可用的文档中的合成数据,然后采用模型融合方法对嵌入进行微调,以提升在新领域的检索性能,同时保持跨域能力。我们在两个公开数据集 SQUAD 和 RAG-12000 以及一个专有的 TOURISM 数据集上进行了实验。结果表明,即使仅利用我们提出的数据增强技术进行标准微调,也优于 vanilla 预训练模型。此外,结合模型融合后,我们的方法在 TOURISM 数据集上在召回率上实现了 5.76% 的提升,在 SQUAD 和 RAG-12000 上的提升分别为 6.58% 和 0.32%。

关键词

引用

@article{arxiv.2410.12890,
  title  = {REFINE on Scarce Data: Retrieval Enhancement through Fine-Tuning via Model Fusion of Embedding Models},
  author = {Ambuje Gupta and Mrinal Rawat and Andreas Stolcke and Roberto Pieraccini},
  journal= {arXiv preprint arXiv:2410.12890},
  year   = {2024}
}

备注

Accepted in AJCAI'24