面向鲁棒语言模型的平滑嵌入
机器学习
2025-01-29 v1 人工智能
计算与语言
密码学与安全
机器学习
摘要
提高大语言模型 (LLM) 的安全性和可靠性是实现可信赖 AI 系统的关键方面。尽管对齐方法旨在抑制有害内容的生成,但 LLM 通常仍然容易受到越狱攻击,这些攻击利用对抗性输入颠覆对齐并诱发有害输出。我们提出了随机嵌入平滑与词元聚合 (RESTA) 防御方法,该方法在嵌入向量中添加随机噪声,并在每个输出词元的生成过程中进行聚合,旨在更好地保留语义信息。我们的实验表明,与基线防御相比,我们的方法实现了更优的鲁棒性与效用权衡。
引用
@article{arxiv.2501.16497,
title = {Smoothed Embeddings for Robust Language Models},
author = {Ryo Hase and Md Rafi Ur Rashid and Ashley Lewis and Jing Liu and Toshiaki Koike-Akino and Kieran Parsons and Ye Wang},
journal= {arXiv preprint arXiv:2501.16497},
year = {2025}
}
备注
Presented in the Safe Generative AI Workshop at NeurIPS 2024