In-Context Learning 可重新学习被禁止的任务
机器学习
2024-02-09 v1 密码学与安全
摘要
尽管在实际部署中投入了大量资源,大型语言模型(LLM)仍然 suffer from 诸多漏洞。从 LLM 安全训练的角度看,它们算法性地禁止模型回答有毒或有害查询。为评估安全训练的有效性,本文研究被禁止的任务,即模型设计为拒绝回答的任务。具体而言,我们调查 Whether in-context learning (ICL) 可用于在模型被设计为拒绝这些任务的同时重新学习禁止任务。我们首先检验一个拒绝情感分类的 toy example 以示问题。随后,我们对在训练为拒绝汇总虚构新闻文章的模型使用 ICL。最后,我们调查 ICL 是否会撤销安全训练,这可能代表重大的安全风险。对于安全任务,我们检查 Vicuna-7B、Starling-7B 和 Llama2-7B。我们表明,攻击在 Starling-7B 和 Vicuna-7B 上即插即用,但在 Llama2-7B 上失败。最后,我们提出一种 ICL 攻击,使用聊天模板标记如同提示注入攻击一样,能在 Vicuna-7B 和 Starling-7B 上实现更好的攻击成功率。警告:附录包含包含暴力、自杀和误导信息的 LLM 生成文本。
引用
@article{arxiv.2402.05723,
title = {In-Context Learning Can Re-learn Forbidden Tasks},
author = {Sophie Xhonneux and David Dobre and Jian Tang and Gauthier Gidel and Dhanya Sridhar},
journal= {arXiv preprint arXiv:2402.05723},
year = {2024}
}
备注
19 pages, 7 figures