中文

面向鲁棒语言模型的平滑嵌入

机器学习 2025-01-29 v1 人工智能 计算与语言 密码学与安全 机器学习

摘要

提高大语言模型 (LLM) 的安全性和可靠性是实现可信赖 AI 系统的关键方面。尽管对齐方法旨在抑制有害内容的生成,但 LLM 通常仍然容易受到越狱攻击,这些攻击利用对抗性输入颠覆对齐并诱发有害输出。我们提出了随机嵌入平滑与词元聚合 (RESTA) 防御方法,该方法在嵌入向量中添加随机噪声,并在每个输出词元的生成过程中进行聚合,旨在更好地保留语义信息。我们的实验表明,与基线防御相比,我们的方法实现了更优的鲁棒性与效用权衡。

关键词

引用

@article{arxiv.2501.16497,
  title  = {Smoothed Embeddings for Robust Language Models},
  author = {Ryo Hase and Md Rafi Ur Rashid and Ashley Lewis and Jing Liu and Toshiaki Koike-Akino and Kieran Parsons and Ye Wang},
  journal= {arXiv preprint arXiv:2501.16497},
  year   = {2025}
}

备注

Presented in the Safe Generative AI Workshop at NeurIPS 2024