RAGulator:用于基于检索文本生成的轻量级脱离上下文检测器
计算与语言
2024-11-07 v1
摘要
对于希望安全采用 RAG 应用的企业而言,实时检测大语言模型输出的脱离上下文内容至关重要。在这项工作中,我们训练轻量级模型来区分语义上脱离上下文的由大语言模型生成的文本与检索到的文本文档。我们通过预处理摘要和语义文本相似度数据集的组合,使用最少的资源构建训练数据。我们发现 DeBERTa 不仅是该流水线中表现最佳的模型,而且速度快,不需要额外的文本预处理或特征工程。虽然新兴研究表明生成式大语言模型也可以进行微调并在复杂数据流水线中使用以达到最先进的性能,但我们注意到速度和资源限制对于本地部署是重要的考虑因素。
引用
@article{arxiv.2411.03920,
title = {RAGulator: Lightweight Out-of-Context Detectors for Grounded Text Generation},
author = {Ian Poey and Jiajun Liu and Qishuai Zhong and Adrien Chenailler},
journal= {arXiv preprint arXiv:2411.03920},
year = {2024}
}