中文

确保文本到图像生成的视觉常识道德性

计算机视觉与模式识别 2023-07-19 v3 计算机与社会

摘要

文本到图像生成方法可生成高分辨率与高质量图像,但这些方法不应生成从常识道德角度看可能包含不当内容的 immoral 图像。本文旨在自动判断合成图像的 immoral 性,并将这些图像操作为道德上可接受的替代图像。为此,我们构建了一个具有三个主要基元的模型:(1)识别给定图像中的视觉常识 immoral 性,(2)定位或高亮导致图像 immoral 的 immoral 视觉(及文本)属性,以及(3)将 immoral 图像操作为具有道德合格性的替代图像。我们使用最先进的 Stable Diffusion 文本到图像生成模型进行了实验与人工研究,证明了我们伦理图像操作方法的有效性。

关键词

引用

@article{arxiv.2212.03507,
  title  = {Ensuring Visual Commonsense Morality for Text-to-Image Generation},
  author = {Seongbeom Park and Suhong Moon and Jinkyu Kim},
  journal= {arXiv preprint arXiv:2212.03507},
  year   = {2023}
}

备注

Workshop on Challenges in Deployable Generative AI at ICML 2023