基于主动学习的RAG增强:拒绝不可回答问题,聚焦可回答问题
计算与语言
2025-02-14 v1
摘要
检索增强生成(RAG)是一种关键技术,可用于利用外部知识并减少大语言模型(LLMs)中的幻觉现象。然而,RAG仍难以完全防止生成幻觉式响应。为此,必须识别易产生幻觉的样本或引导LLMs向正确响应,专家随后对其进行标注以开发高质量数据集以精炼LLMs。然而,日益稀缺的数据集使得其创建颇具挑战性。本文提出利用广泛使用的LLMs对话记录构建这些数据集,训练LLMs以避免幻觉引发的问题,同时准确回答可管理的问题。鉴于专家标注所有对话记录的不可行性,本文引入AL4RAG,通过主动学习选择最适合标注的对话样本,在标注预算内优化性能。此外,鉴于传统主动学习方法在RAG中不完全兼容,由于不合适的距离度量标准,本文开发了一种针对RAG主动学习的新型样本距离度量方法。大量实验表明,我们的方法在多个指标上 consistently 优于基线方法。
引用
@article{arxiv.2502.09073,
title = {Enhancing RAG with Active Learning on Conversation Records: Reject Incapables and Answer Capables},
author = {Xuzhao Geng and Haozhao Wang and Jun Wang and Wei Liu and Ruixuan Li},
journal= {arXiv preprint arXiv:2502.09073},
year = {2025}
}