中文

面向安全图像生成的值对齐提示 moderated 通过零样本智能代理重写

人工智能 2025-11-18 v1 密码学与安全 计算机视觉与模式识别 机器学习

摘要

生成式视觉语言模型如 Stable Diffusion 在创意媒体合成方面展现出惊人的能力,但在对抗性提示下也会产生不安全、冒犯或文化不当的内容。现有防御方法在不牺牲生成质量或高成本的前提下,难以实现与人类价值观的对齐。为此,我们引入 VALOR(Value-Aligned LLM-Overseen Rewriter),一个模块化、零样本的智能代理框架,用于更安全、更实用的文本到图像生成。VALOR 集成了分层提示分析与人类价值推理:多级 NSFW 检测器过滤词汇和语义风险;文化价值对齐模块识别社会规范、合法性和表征伦理的违规;意图歧义器检测细微或间接的不安全含义。当检测到不安全内容时,提示将在动态、角色特定的指令下被重写,以保留用户意图同时实现对齐。如果生成的图像仍不通过安全检查,VALOR 可选执行风格化重生成,将输出引导至更安全的视觉领域,而不改变核心语义。跨对抗、模糊和价值敏感提示的实验表明,VALOR 将不安全输出显著减少最高可达 100.00%,同时保持提示的实用性和创造性。这些结果突显了 VALOR 作为在开放世界环境中部署安全、对齐且实用图像生成系统的可扩展且有效的方法。

关键词

引用

@article{arxiv.2511.11693,
  title  = {Value-Aligned Prompt Moderation via Zero-Shot Agentic Rewriting for Safe Image Generation},
  author = {Xin Zhao and Xiaojun Chen and Bingshan Liu and Zeyao Liu and Zhendong Zhao and Xiaoyan Gu},
  journal= {arXiv preprint arXiv:2511.11693},
  year   = {2025}
}