文本到图像扩散模型的个性化安全对齐
计算机视觉与模式识别
2026-02-06 v3 人工智能
摘要
文本到图像扩散模型已彻底改变视觉内容生成,但其部署受限于根本性瓶颈:安全机制实施刚性统一标准,无法反映由年龄、文化或个人信念形成的多样化用户偏好。为此,我们提出个性化安全对齐(PSA)框架,使生成式安全从静态过滤过渡到用户条件化适应。我们引入Sage,一个大规模数据集,覆盖1000个模拟用户档案,涵盖传统数据集常忽视的复杂风险。通过参数高效的跨注意力适配器整合这些档案,PSA可动态调节生成以符合个体敏感度。在实验中,PSA实现了校准的安全-质量权衡:在包容性档案下放宽过于谨慎的约束以提升视觉保真度,在限制性档案下强化最先进的抑制,显著超越静态基线。此外,PSA在指令遵循度上优于提示工程方法,确立了个性化作为创建自适应、以用户为中心且负责任的生成式AI的关键方向。我们的代码、数据和模型已公开:https://github.com/M-E-AGI-Lab/PSAlign。
引用
@article{arxiv.2508.01151,
title = {Personalized Safety Alignment for Text-to-Image Diffusion Models},
author = {Yu Lei and Jinbin Bai and Qingyu Shi and Aosong Feng and Hongcheng Gao and Xiao Zhang and Rex Ying},
journal= {arXiv preprint arXiv:2508.01151},
year = {2026}
}