图像完美的瑕疵:文本到图像模型演进阴影下的安全性、偏见与真实性
密码学与安全
2024-09-02 v1 机器学习
摘要
文本到图像模型,如 Stable Diffusion (SD),经历迭代更新以提高图像质量并解决诸如安全性等问题。图像质量的提升易于评估。然而,模型更新如何解决现有问题以及它们是否引发新问题仍未被探索。本研究从安全性、偏见和真实性的角度出发,迈出了研究文本到图像模型演进的第一步。我们以 Stable Diffusion 为中心的发现表明,模型更新呈现出喜忧参半的局面。虽然更新逐步减少了不安全图像的生成,但偏见问题,特别是性别偏见,却加剧了。我们还发现,负面刻板印象要么在同一非白人种族群体内持续存在,要么通过 SD 更新转向其他非白人种族群体,而这些特征与白人种族群体的关联极少。此外,我们的评估揭示了 SD 更新引发的一个新问题:最初为早期 SD 版本训练的最先进的虚假图像检测器,难以识别由更新版本生成的虚假图像。我们表明,在由更新版本生成的虚假图像上对这些检测器进行微调,在各种 SD 版本上均能达到至少 96.6% 的准确率,从而解决了这一问题。我们的见解强调了在不断演进的文本到图像模型中持续努力缓解偏见和漏洞的重要性。
引用
@article{arxiv.2408.17285,
title = {Image-Perfect Imperfections: Safety, Bias, and Authenticity in the Shadow of Text-To-Image Model Evolution},
author = {Yixin Wu and Yun Shen and Michael Backes and Yang Zhang},
journal= {arXiv preprint arXiv:2408.17285},
year = {2024}
}
备注
To Appear in the ACM Conference on Computer and Communications Security, October 14-18, 2024