开源大语言模型的安全性:对齐真能防止其被滥用吗?
机器学习
2023-10-04 v1 人工智能
密码学与安全
摘要
大语言模型(LLM)在自然语言生成(NLG)任务中取得了前所未有的性能。然而,许多现有研究表明其可能被滥用于生成不良内容。作为应对,模型开发者在公开发布 LLM 前,通常通过监督微调(SFT)或基于人类反馈的强化学习(RLHF)对这些语言模型进行对齐。因此,那些对齐后的大语言模型在面对潜在有害/不道德请求时会拒绝生成不良内容。一个自然的问题是“对齐真能防止这些开源大语言模型被滥用来生成不良内容吗?”。本文对该问题给出否定回答。具体而言,我们展示这些开源的、已对齐的大语言模型可在无需大量计算或精心提示设计的情况下被轻易误导以生成不良内容。我们的核心思路是直接操纵开源 LLM 的生成过程,误导其生成包括有害或偏见信息乃至私有数据在内的不良内容。我们在 4 个公开可访问的开源 LLM 上评估了该方法,结果凸显了对开源 LLM 采取更先进缓解策略的必要性。
引用
@article{arxiv.2310.01581,
title = {On the Safety of Open-Sourced Large Language Models: Does Alignment Really Prevent Them From Being Misused?},
author = {Hangfan Zhang and Zhimeng Guo and Huaisheng Zhu and Bochuan Cao and Lu Lin and Jinyuan Jia and Jinghui Chen and Dinghao Wu},
journal= {arXiv preprint arXiv:2310.01581},
year = {2023}
}