基于多维攻防提升大模型生成安全性的方法
密码学与安全
2025-01-03 v1 人工智能
摘要
当前大模型在面对复杂攻击指令时容易生成有害内容,显著降低其防御能力。为此,本文提出一种基于构建与多维攻防一致的数据来增强大模型生成安全的方法。本方法的核心在于通过创新性地增加攻击指令维度的多样性和提高生成安全响应的准确性,从而提升大模型安全对齐学习的效果。为验证本方法的有效性,除现有的安全评估基准外,本文还设计了新的安全评估基准,并以 Llama3.2 为基线模型进行比较实验。最终的实验结果表明,本方法显著提高了在复杂指令攻击下的大模型生成安全性,同时保持并提升了模型的通用能力。
引用
@article{arxiv.2501.00517,
title = {A Method for Enhancing the Safety of Large Model Generation Based on Multi-dimensional Attack and Defense},
author = {Keke Zhai},
journal= {arXiv preprint arXiv:2501.00517},
year = {2025}
}