StyleMamba:用于高效文本驱动图像风格迁移的状态空间模型
计算机视觉与模式识别
2024-05-09 v1 人工智能
摘要
我们提出了 StyleMamba,这是一个高效的图像风格迁移框架,能够将文本提示转换为相应的视觉风格,同时保留原始图像的内容完整性。现有的文本引导风格化方法需要数百次训练迭代,并消耗大量计算资源。为了加速这一过程,我们提出了一种用于高效文本驱动图像风格迁移的条件状态空间模型,称为 StyleMamba,该模型将图像特征与目标文本提示进行顺序对齐。为了增强文本与图像之间的局部和全局风格一致性,我们提出了掩码和二阶方向损失来优化风格化方向,从而将训练迭代次数显著减少 5 倍,推理时间减少 3 倍。大量实验和定性评估证实,与现有基线方法相比,我们的方法具有稳健且优越的风格化性能。
引用
@article{arxiv.2405.05027,
title = {StyleMamba : State Space Model for Efficient Text-driven Image Style Transfer},
author = {Zijia Wang and Zhi-Song Liu},
journal= {arXiv preprint arXiv:2405.05027},
year = {2024}
}
备注
Blind submission to ECAI 2024