超越颜色与线条:基于语义协调的零样本风格特定图像变体
计算机视觉与模式识别
2024-10-25 v1
摘要
传统上,风格主要以艺术元素(如颜色、笔触和光照)来考虑。然而,相同的语义主体(如人物、船只和房屋)在不同的艺术传统中会有显著差异,表明风格还包含底层语义。因此,本研究提出了一个用于语义协调图像变体的零样本方案。具体而言,我们将图像到图像问题转化为图像到文本到图像问题。图像到文本操作采用视觉语言模型(如BLIP)生成描述输入图像内容的文本,包括物体及其位置。随后,将输入风格关键词详化为该风格的详细描述,然后通过ChatGPT的推理能力将其与内容文本合并。最后,文本到图像操作利用扩散模型根据文本提示生成图像。为使扩散模型能够容纳更多风格,我们提出了一种微调策略,将文本和风格约束注入交叉注意力,从而确保输出图像在所需风格下具有相似的语义。为验证所提方案的性能,我们构建了一个包含多种风格和场景图像的基准,并引入了两个新指标。尽管方法简单,但该方案在零样本方式下能产生高度合理的结果,尤其是在生成高保真语义的风格化图像方面。
引用
@article{arxiv.2410.18537,
title = {Beyond Color and Lines: Zero-Shot Style-Specific Image Variations with Coordinated Semantics},
author = {Jinghao Hu and Yuhe Zhang and GuoHua Geng and Liuyuxin Yang and JiaRui Yan and Jingtao Cheng and YaDong Zhang and Kang Li},
journal= {arXiv preprint arXiv:2410.18537},
year = {2024}
}
备注
13 pages,6 figures