检索增强语言模型中基于噪声鲁棒的抽象压缩
计算与语言
2025-12-11 v1 人工智能
摘要
抽象压缩利用较小语言模型来精简查询相关上下文,减少检索增强生成(RAG)中的计算成本。然而,检索文档常包含与回答查询无关或因事实错误内容而误导的信息,尽管具有高相关性得分。这一行为表明,抽象压缩器更倾向于忽略对于正确答案至关重要的重要信息,尤其在长上下文中注意力分散的情况下。为解决此问题,我们更细粒度地对检索文档进行分类,提出抗噪声抽象压缩(ACoRN),该方法引入两种新训练步骤。首先,我们对训练数据集进行离线数据增强,以增强压缩器对两种不同检索噪声的鲁棒性。其次,由于基于语言模型的压缩器无法充分利用来自多个检索文档的信息并存在位置偏差,我们进行微调以生成以直接支持正确答案的关键信息为中心的摘要。我们的实验表明,采用 ACoRN 训练的 T5-large 在保持答案字符串的同时提升了 EM 和 F1 分数,作为直接证据。ACoRN 在包含大量降低准确性文档的数据集上表现出色,在现实场景中具有高度实用性。
引用
@article{arxiv.2512.08943,
title = {Noise-Robust Abstractive Compression in Retrieval-Augmented Language Models},
author = {Singon Kim},
journal= {arXiv preprint arXiv:2512.08943},
year = {2025}
}
备注
Master's thesis, Korea University, 2025