WikiStyle+:面向艺术图像风格化的内容-风格表征解耦的多模态方法
计算机视觉与模式识别
2025-04-15 v2
摘要
艺术图像风格化旨在以目标风格渲染由文本或图像提供的内容,其中内容与风格的解耦是实现令人满意结果的关键。然而,当前的内容和风格解耦方法主要依赖图像监督,导致两个问题:1)模型只能支持内容或风格输入的单一模态;2)导致内容从参考图像中泄漏的解耦不完整。为解决上述问题,本文提出了一种面向艺术图像风格化的内容-风格解耦的多模态方法。我们构建了一个由具有对应文本描述的艺术品组成的 \textit{WikiStyle+} 数据集,用于风格和内容。基于该多模态数据集,我们提出了一种以解耦表征为导向的扩散模型。首先通过 Q-Formers 学习解耦表征,然后通过可学习的多级交叉注意力层注入到预训练的扩散模型中。实验结果表明,我们的方法在多模态监督下实现了参考图像中内容和风格的彻底解耦,从而实现了更精细的风格化处理,符合参考风格的艺术特征。本方法的代码将在接受后公开。
引用
@article{arxiv.2412.14496,
title = {WikiStyle+: A Multimodal Approach to Content-Style Representation Disentanglement for Artistic Image Stylization},
author = {Ma Zhuoqi and Zhang Yixuan and You Zejun and Tian Long and Liu Xiyang},
journal= {arXiv preprint arXiv:2412.14496},
year = {2025}
}