动态引导与领域适用的安全防护:增强大型语言模型的安全性
人工智能
2025-02-11 v2
摘要
随着大型语言模型(LLM)的广泛部署,确保其安全性变得日益关键。然而,现有的防御方法常常面临两个关键问题:(i) 防御能力不足,特别是在化学等特定领域场景中,由于缺乏专业知识,可能导致对恶意查询生成有害响应。(ii) 过度防御,这损害了LLM的通用效用和响应能力。为缓解这些问题,我们引入了一个基于多智能体的防御框架——引导式防御(G4D),该框架利用准确的外部信息提供用户意图的无偏摘要以及基于分析的安全响应指导。在流行的越狱攻击和良性数据集上的大量实验表明,我们的G4D能够在不损害模型通用功能的前提下,增强LLM在通用和特定领域场景下对抗越狱攻击的鲁棒性。
引用
@article{arxiv.2410.17922,
title = {Dynamic Guided and Domain Applicable Safeguards for Enhanced Security in Large Language Models},
author = {Weidi Luo and He Cao and Zijing Liu and Yu Wang and Aidan Wong and Bing Feng and Yuan Yao and Yu Li},
journal= {arXiv preprint arXiv:2410.17922},
year = {2025}
}