中文

通过双空间多维度概念控制实现即插即用、可解释且负责任的文本到图像生成

计算机视觉与模式识别 2025-03-25 v1 人工智能

摘要

文本到图像(T2I)模型相关的伦理问题要求对生成内容进行全面控制。旨在解决负责任 T2I 模型这些问题的现有技术,其目标是使生成内容公平且安全(无暴力/露骨内容)。然而,这些方法仍然局限于单独处理责任概念的各个维度,同时也缺乏可解释性。此外,它们通常需要对原始模型进行修改,这会损害模型性能。在这项工作中,我们提出了一种独特的技术,通过以可扩展的方式同时考虑广泛的概念来进行公平和安全的内容生成,从而实现负责任的 T2I 生成。其核心思想是利用一个外部即插即用机制蒸馏目标 T2I 流水线,该机制以目标 T2I 流水线为条件,为所需概念学习一个可解释的复合责任空间。我们利用知识蒸馏和概念白化来实现这一点。在推理阶段,利用学习到的空间来调节生成内容。典型的 T2I 流水线为我们的方法提供了两个插入点,即文本嵌入空间和扩散模型潜在空间。我们为这两个插入点开发了模块,并通过一系列强有力的结果展示了我们方法的有效性。

关键词

引用

@article{arxiv.2503.18324,
  title  = {Plug-and-Play Interpretable Responsible Text-to-Image Generation via Dual-Space Multi-facet Concept Control},
  author = {Basim Azam and Naveed Akhtar},
  journal= {arXiv preprint arXiv:2503.18324},
  year   = {2025}
}