ORES:开放词汇负责任视觉合成
计算机视觉与模式识别
2023-08-29 v1
摘要
避免合成特定视觉概念是负责任视觉合成中的一项基本挑战。然而,负责任视觉合成中需避免的视觉概念往往多样,取决于地区、语境和使用场景。本文形式化了一项新任务——开放词汇负责任视觉合成(ORES),其中合成模型能够避免禁用的视觉概念,同时允许用户输入任意期望内容。为解决该问题,我们提出两阶段干预(TIN)框架。通过引入 1) 基于大规模语言模型(LLM)的可学习指令重写,以及 2) 在扩散合成模型上带提示干预的合成,可高效合成避开任何概念且尽可能遵循用户查询的图像。为在 ORES 上评测,我们提供了一个公开可用数据集、基线模型和基准。实验结果证明了我们的方法在降低图像生成风险方面的有效性。我们的工作凸显了 LLM 在负责任视觉合成中的潜力。我们的代码与数据集已公开可用。
引用
@article{arxiv.2308.13785,
title = {ORES: Open-vocabulary Responsible Visual Synthesis},
author = {Minheng Ni and Chenfei Wu and Xiaodong Wang and Shengming Yin and Lijuan Wang and Zicheng Liu and Nan Duan},
journal= {arXiv preprint arXiv:2308.13785},
year = {2023}
}