搭建安全鸿沟:面向可靠 LLM 推理的警戒管道
人工智能
2025-02-13 v1
摘要
我们提出 Wildflare GuardRail,这是一个警戒管道,旨在通过系统性地解决整个处理流程中的风险,来增强大型语言模型(LLM)推理的安全性和可靠性。Wildflare GuardRail 集成了多个核心功能模块,包括 Safety Detector 用于识别不安全输入并检测模型输出中的幻觉,同时生成根因解释;Grounding 通过检索向量数据库中的信息来 contextualize 用户查询;Customizer 使用轻量级规则包装器实时调整输出;Repairer 则利用 Safety Detector 提供的幻觉解释来纠正错误的 LLM 输出。结果表明,Safety Detector 中的不安全内容检测模型在性能上与 OpenAI API 相当,虽然基于几个公开数据集构建的小数据集训练。而且,轻量级包装器能以 1.06 秒/查询的速度以 100% 准确率处理模型输出中的恶意 URL,无需昂贵的模型调用。此外,幻觉修复模型在减少幻觉方面效果显著,准确率达 80.7%。
引用
@article{arxiv.2502.08142,
title = {Bridging the Safety Gap: A Guardrail Pipeline for Trustworthy LLM Inferences},
author = {Shanshan Han and Salman Avestimehr and Chaoyang He},
journal= {arXiv preprint arXiv:2502.08142},
year = {2025}
}
备注
arXiv admin note: text overlap with arXiv:2406.10847