面向大语言模型文本生成的实时安全保障框架
计算与语言
2025-05-22 v3 人工智能
摘要
大型语言模型(LLM)在自然语言处理任务中取得了显著进展,但由于倾向于生成有害内容,也带来了伦理和社会风险。现有方法存在局限,包括需要训练特定控制模型以及在文本生成过程中主动干预,从而导致质量下降和计算开销增加。为缓解这些局限,我们提出了 LLMSafeGuard,一个轻量级实时框架,将外部验证器集成到解码过程中,在拒绝不安全输出的同时允许有效输出通过。我们引入基于相似度的验证方法,简化了约束引入,无需控制模型训练。此外,LLMSafeGuard 采用情境相关时机选择策略,仅在必要时干预。我们在去毒和版权保护方面评估了 LLMSafeGuard,证明其优于 SOTA baseline。在去毒方面,LLMSafeGuard 将有害输出减少至少 38.6%,同时保持语言质量。此外,其情境相关时机选择在不影响效果的前提下将推理时间缩短至少 24.2%。
引用
@article{arxiv.2404.19048,
title = {A Framework for Real-time Safeguarding the Text Generation of Large Language Model},
author = {Ximing Dong and Dayi Lin and Shaowei Wang and Ahmed E. Hassan},
journal= {arXiv preprint arXiv:2404.19048},
year = {2025}
}