安全算术:通过引导参数和激活实现语言模型测试时安全对齐的框架
计算与语言
2024-10-29 v2
摘要
确保大型语言模型(LLM)与人类价值观的安全对齐至关重要,因为它们正逐渐成为诸如翻译和问答等应用的核心组成部分。当前的对齐方法在应对动态用户意图和复杂目标方面存在挑战,使得模型容易生成有害内容。我们提出了安全算术(safety Arithmetic),一个无需训练的框架,用于增强LLM在不同情景下的安全性:基础模型、监督微调模型(SFT)和编辑模型。安全算术包括损害方向移除以避免有害内容,以及安全对齐以促进安全响应。此外,我们还提出了NoIntentEdit数据集,突出显示了若无意中使用的编辑实例可能削弱模型安全性的问题。我们的实验表明,安全算术显著改善了安全措施,减少了过度安全,同时保持了模型实用性,在确保安全内容生成方面优于现有方法。
关键词
引用
@article{arxiv.2406.11801,
title = {Safety Arithmetic: A Framework for Test-time Safety Alignment of Language Models by Steering Parameters and Activations},
author = {Rima Hazra and Sayan Layek and Somnath Banerjee and Soujanya Poria},
journal= {arXiv preprint arXiv:2406.11801},
year = {2024}
}
备注
EMNLP 2024 Main. Codes are available at: https://github.com/declare-lab/safety-arithmetic