Luna:一种高精度、低成本捕捉语言模型幻觉的评估基础模型
计算与语言
2024-06-06 v2 人工智能
摘要
检索增强生成(RAG)系统通过整合外部知识检索机制,已成为增强语言模型能力的关键。然而,在工业应用中部署这些系统的一个重大挑战是检测和缓解幻觉:即模型生成与检索上下文不符的信息的情况。解决这个问题对于确保大型语言模型(LLM)在不同工业环境中生成响应的可靠性和准确性至关重要。当前的幻觉检测技术无法同时实现高精度、低延迟和低成本。我们引入了Luna:一个DeBERTA-large(440M)编码器,针对RAG环境中的幻觉检测进行了微调。我们证明,Luna在幻觉检测任务上优于GPT-3.5和商业评估框架,成本和延迟分别降低了97%和91%。Luna轻量级,并且能够泛化到多个行业垂直领域和域外数据,使其成为工业LLM应用的理想候选方案。
引用
@article{arxiv.2406.00975,
title = {Luna: An Evaluation Foundation Model to Catch Language Model Hallucinations with High Accuracy and Low Cost},
author = {Masha Belyi and Robert Friel and Shuai Shao and Atindriyo Sanyal},
journal= {arXiv preprint arXiv:2406.00975},
year = {2024}
}