基于文本引导的可控扩散野生哈顿图像生成
计算机视觉与模式识别
2025-11-26 v1
摘要
野生哈顿图像生成(CIG)是一项新兴研究领域,旨在合成对象与周环境高度一致且具备高视觉一致性的图像。现有方法通过将对象融合到特定背景或利用前景对象引导的 outpainting 方式实现 CIG,但往往难以获得自然结果,因为忽略了野生哈顿对象与背景环境之间的逻辑关系。为此,我们提出 CT-CIG 方法,即 Controllable Text-guided Camouflage Images Generation,产生真实且逻辑合理的野生哈顿图像。借助大型视觉语言模型(VLM),我们设计了 Camouflage-Revealing Dialogue Mechanism(CRDM),为现有野生哈顿数据集标注高质量文本提示。随后,使用构建好的图像-提示配对对 Stable Diffusion 进行微调,并引入轻量级控制器引导野生哈顿对象的位置和形状,以提升野生哈顿场景的适配度。此外,我们设计了 Frequency Interaction Refinement Module(FIRM),以捕获高频纹理特征,促进野生哈顿图案的学习。大量实验,包括 CLIPScore 评估和野生哈顿有效性评估,表明我们的生成文本提示在语义上一致,CT-CIG 能够产生照片般的野生哈顿图像。
引用
@article{arxiv.2511.20218,
title = {Text-guided Controllable Diffusion for Realistic Camouflage Images Generation},
author = {Yuhang Qian and Haiyan Chen and Wentong Li and Ningzhong Liu and Jie Qin},
journal= {arXiv preprint arXiv:2511.20218},
year = {2025}
}
备注
Accepted by AAAI 2026