通过人类反馈反向消除保护文本到图像扩散模型
计算机视觉与模式识别
2024-08-01 v1 人工智能
摘要
本文针对大规模文本到图像扩散模型生成潜在有害或受版权保护内容所引发的社会问题进行了应对。现有模型高度依赖互联网爬取的数据,其中由于筛选过程不完整,问题概念仍然存在。虽然前述方法在某种程度上缓解了此问题,但它们往往依赖于文本指定的概念,这会带来挑战,难以准确捕捉细化概念,并将模型知识与人类理解对齐。在此响应下,我们提出了一种名为人类反馈反向消除(Human Feedback Inversion, HFI)的框架,其中对模型生成图像的人类反馈被压缩为引导消除或移除有害图像的文本标记。该框架可建立在用于相同目的的现有技术之上,从而增强其与人类判断力的对齐。通过这种方式,我们以自蒸馈技术简化了训练目标,为概念消除提供了强有力的基准。我们的实验结果表明,该框架显著减少了有害内容的生成,同时保持了图像质量,为AI在公共领域的伦理部署作出了贡献。
引用
@article{arxiv.2407.21032,
title = {Safeguard Text-to-Image Diffusion Models with Human Feedback Inversion},
author = {Sanghyun Kim and Seohyeon Jung and Balhae Kim and Moonseok Choi and Jinwoo Shin and Juho Lee},
journal= {arXiv preprint arXiv:2407.21032},
year = {2024}
}
备注
ECCV 2024. 56 pages, 24 figures. Caution: This paper contains discussions and examples related to harmful content, including text and images. Reader discretion is advised. Code is available at https://github.com/nannullna/safeguard-hfi