PISCO:面向检索增强生成的简约压缩
计算与语言
2025-01-28 v1 人工智能
信息检索
摘要
检索增强生成 (RAG) 流水线通过检索相关文档来增强大型语言模型 (LLM),但由于高推理成本和有限的上下文大小,面临可扩展性问题。文档压缩是一种实用解决方案,但当前的软压缩方法在准确性方面存在损失,并需要大量预训练。本文介绍了 PISCO,一种新颖的方法,在多样化的RAG-based question-answering (QA) 任务中实现 16 倍压缩率,准确性损失最小(0-3%)。与现有方法不同,PISCO 无需预训练或标注数据,仅依赖于基于文档的问题的序列级知识蒸馏。PISCO 能够在单块 A100 GPU 上在 48 小时内微调 7-10B 参数的 LLM,提供一种高效且可扩展的解决方案。我们 presented comprehensive experiments showing that PISCO outperforms existing compression models by 8% in accuracy。
引用
@article{arxiv.2501.16075,
title = {PISCO: Pretty Simple Compression for Retrieval-Augmented Generation},
author = {Maxime Louis and Hervé Déjean and Stéphane Clinchant},
journal= {arXiv preprint arXiv:2501.16075},
year = {2025}
}