CogMorph:用于文本到图像模型的认知形态化攻击
计算机视觉与模式识别
2025-01-23 v2
摘要
文本到图像(T2I)生成模型的发展,使能够从文本提示中创建高质量合成图像,开拓了创意设计和内容生成的新前沿。然而,本文揭示了该技术固有的显著且之前未被认识到的伦理风险,并引入了一种新方法,称为认知形态化攻击(CogMorph),该方法可操控T2I模型以生成保留原始核心主题但嵌入有毒或有害情境元素的图像。这种细微的操控利用了人类概念感知被整个视觉场景及其情境所塑造的认知原理,产生远超仅仅保留原始语义的攻击所放大的情感伤害。为此,我们首先构建了一个涵盖10大类和48子类的图像毒性分类学,与人类认知感知维度相匹配,并进一步构建了一个毒性风险矩阵,产生1176个高质量T2I有毒提示。基于此,CogMorph首先引入认知毒性增强,开发了一个丰富的外部有害表示知识库(例如精细的视觉特征),可供人类利用以进一步指导对抗性提示的优化。此外,我们提出了情境分层形态化,该方法分层提取原始提示的关键部分(例如场景、主题和身体部位),然后依次检索并融合有毒特征以注入有害情境。针对多个开源T2I模型和黑盒商业API(例如DALLE-3)进行大量实验,证明了CogMorph的有效性,其平均性能显著超过其他基线方法+20.62%。
引用
@article{arxiv.2501.11815,
title = {CogMorph: Cognitive Morphing Attacks for Text-to-Image Models},
author = {Zonglei Jing and Zonghao Ying and Le Wang and Siyuan Liang and Aishan Liu and Xianglong Liu and Dacheng Tao},
journal= {arXiv preprint arXiv:2501.11815},
year = {2025}
}