用于规避扩散模型概念抑制的概念算术
计算机视觉与模式识别
2024-04-23 v1 人工智能
机器学习
摘要
受伦理和法律顾虑的驱动,科学社区正在积极 developing 方法来限制滥用文本到图像扩散模型生成的受版权保护、暴力、裸露或个人信息的图像。同时,研究人员正在扮演对手角色,测试这些新开发的安全措施,寻找其中的漏洞和后门。我们利用扩散模型的组合性质,该性质允许在单次图像生成中利用多个提示。这种性质允许我们将其他概念(即使这些概念不受抑制)组合起来,以重建负责目标概念生成的向量,尽管该向量的直接计算已不再可访问。我们提供了该攻击可能性的理论和实证依据,并讨论了这些发现对安全模型部署的影响。我们认为,必须考虑所有可能用于图像生成的扩散模型方法,这些方法都可能被对手利用。本工作开启了关于概念算术和扩散模型中组合推理对安全机制影响的讨论。内容声明:本文包含可能被视为冒犯的讨论和模型生成内容,建议读者自行判断。项目页面:https://cs-people.bu.edu/vpetsiuk/arc
引用
@article{arxiv.2404.13706,
title = {Concept Arithmetics for Circumventing Concept Inhibition in Diffusion Models},
author = {Vitali Petsiuk and Kate Saenko},
journal= {arXiv preprint arXiv:2404.13706},
year = {2024}
}