无需语义扰动的安全图像生成:基于上下文保护的双潜在重建
计算机视觉与模式识别
2025-03-06 v2 人工智能
摘要
在大型未精选数据集上训练多模态生成模型可能导致用户接触到有害、不可靠且争议性或文化上不恰当的输出。虽然模型编辑被提议用于删除或过滤嵌入和潜在空间中的不希望概念,但它可能无意中损坏已学习的流形,导致靠近语义的概念失真。我们识别了当前模型编辑技术的局限性,表明即使是良好且接近的概念也可能失去一致性。为满足安全内容生成的需求,我们利用安全嵌入和带可调权重求和的修改扩散过程在潜在空间中生成更安全的图像。我们的方法在不损害已学习流形结构的前提下保持全局语境。我们在安全图像生成基准测试上实现了最先进的效果,并对模型安全性提供了直观的控制。我们识别了安全性与审查之间的权衡,这为开发伦理AI模型提供了必要的视角。我们将发布我们的代码。
引用
@article{arxiv.2411.13982,
title = {Safety Without Semantic Disruptions: Editing-free Safe Image Generation via Context-preserving Dual Latent Reconstruction},
author = {Jordan Vice and Naveed Akhtar and Mubarak Shah and Richard Hartley and Ajmal Mian},
journal= {arXiv preprint arXiv:2411.13982},
year = {2025}
}
备注
This research is supported by the NISDRG project #20100007, funded by the Australian Government