中文

使大语言模型不可学习有害行为

机器学习 2023-11-07 v1 人工智能 计算机与社会

摘要

大语言模型(LLMs)作为各领域通用 AI 助手已展现出巨大潜力。为满足不同应用的需求,LLMs 通常通过进一步微调进行定制。然而,LLMs 强大的学习能力不仅使它们能习得新任务,也易使其学到不期望的行为。例如,即便经过安全对齐的 LLMs 也可能因微调数据常含隐式或显式有害内容而被轻易微调为有害助手。我们能否在有害数据上训练 LLMs 而不学习有害行为?本文提出一种可控训练框架,使有害行为在微调过程中不可学习。具体而言,我们引入“安全向量”(security vectors),即少数可从 LLM 分离的新参数,以确保 LLM 的响应与有害行为一致。安全向量在微调时被激活,一致的行为使 LLM 认为该行为已被学会,无需针对有害数据进一步优化。推理时,我们可停用安全向量以恢复 LLM 的正常行为。实验结果表明,由 100 个有害样本生成的安全向量足以阻止 LLM 学习 1000 个有害样本,同时保留学习其他有用信息的能力。

关键词

引用

@article{arxiv.2311.02105,
  title  = {Making Harmful Behaviors Unlearnable for Large Language Models},
  author = {Xin Zhou and Yi Lu and Ruotian Ma and Tao Gui and Qi Zhang and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2311.02105},
  year   = {2023}
}

备注

work in process