中文

SPQR:面向文本到图像扩散模型的现代安全对齐方法标准化基准

密码学与安全 2025-11-26 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

文本到图像扩散模型可能生成受版权保护、unsafe 或私人内容。安全对齐旨在抑制特定概念,但评估很少测试安全性在 benign downstream fine-tuning(例如 LoRA 个人化、风格/领域适配器)之后是否仍然有效。我们研究了当前安全方法在 benign fine-tuning 下的稳定性并观察到经常发生崩溃。由于真正的安全对齐必须 withstand 即使 benign post-deployment 适应,我们引入了 SPQR 基准(Safety-Prompt adherence-Quality-Robustness)。SPQR 是一个单一评分指标,提供一个标准化和可重复的框架来评估安全对齐扩散模型在 benign fine-tuning 下保持安全性、实用性和鲁棒性,同时报告单一的 leaderboard 分数以便于比较。我们进行了多语言、领域特定和超出分布的分析,以及类别级的细分,以识别在 benign fine-tuning 之后安全对齐何时失败,最终展示了 SPQR 作为面向文本到图像模型的安全对齐技术的简洁而全面的基准。

关键词

引用

@article{arxiv.2511.19558,
  title  = {SPQR: A Standardized Benchmark for Modern Safety Alignment Methods in Text-to-Image Diffusion Models},
  author = {Mohammed Talha Alam and Nada Saadi and Fahad Shamshad and Nils Lukas and Karthik Nandakumar and Fahkri Karray and Samuele Poppi},
  journal= {arXiv preprint arXiv:2511.19558},
  year   = {2025}
}

备注

20 pages, 8 figures, 10 tables