通过约束嵌入安全区域实现负责任的扩散模型
计算与语言
2025-05-22 v1 人工智能
摘要
扩散模型在生成高保真图像方面展现卓越能力,广泛应用于实际场景。然而,这些模型也可能产生 Not Safe for Work (NSFW) 内容并呈现社会偏见,限制了其实际应用。为此,现有研究主要通过安全过滤器识别并排除有毒文本,或微调预训练扩散模型以擦除敏感概念。然而,这些方法在性能和实际效果上仍有不足:一方面显著影响正常模型输出,另一方面仍未能完全防止某些有害内容的生成。本文提出一种新颖的自发现方法,在嵌入空间中识别语义方向向量,将文本嵌入限制在安全区域内,从而无需纠正输入文本中的 individual 单词,即可引导整个文本提示走向安全区域,提高模型对所有可能的不安全提示的鲁棒性。此外,我们采用低秩适配 (LoRA) 进行语义方向向量初始化,以减少对其他语义的模型性能影响。该方法还可与现有方法集成以提升社会责任感。广泛实验表明,我们的方法在多个 SOTA 基准上有效降低了 NSFW 内容生成并缓解了扩散模型产生的社会偏见。
引用
@article{arxiv.2505.15427,
title = {Responsible Diffusion Models via Constraining Text Embeddings within Safe Regions},
author = {Zhiwen Li and Die Chen and Mingyuan Fan and Cen Chen and Yaliang Li and Yanhao Wang and Wenmeng Zhou},
journal= {arXiv preprint arXiv:2505.15427},
year = {2025}
}