面向多视图一致风格迁移的单步扩散方法:基于视觉条件
计算机视觉与模式识别
2024-11-18 v1
摘要
3D 场景风格化是 3D 计算机视觉中的一个日益受关注的议题。尽管图像风格迁移已广泛研究并取得良好成果,但直接将 2D 风格迁移方法应用于 3D 场景常常无法保持其结构和多视图特性,导致不同视角图像出现令人不愉快的畸变。为此,我们利用扩散模型的卓越生成先验,提出一种新颖的风格迁移方法 OSDiffST,基于预训练的单步扩散模型(即 SD-Turbo)实现 3D 场景多视图图像的多样化风格渲染。为高效适配小数据集上的多视图风格迁移,我们引入视觉条件模块从参考风格图像中提取风格信息作为扩散模型的条件输入,并在扩散模型中采用 LoRA 进行适配。此外,我们设计两个特定损失函数考虑风格化图像与内容图像之间的颜色分布对齐和结构相似性。结果表明,我们的方法无需任何 3D 信息即可有效保持风格化图像中的结构信息和多视图一致性。实验显示,我们的方法在合成 3D 场景多视图图像的各种风格方面优于其他有前景的风格迁移方法。由我们方法生成的不同视角图像在视觉质量上表现出优越,结构完整性更好,畸变更少。源码已公开于 https://github.com/YushenZuo/OSDiffST。
引用
@article{arxiv.2411.10130,
title = {Towards Multi-View Consistent Style Transfer with One-Step Diffusion via Vision Conditioning},
author = {Yushen Zuo and Jun Xiao and Kin-Chung Chan and Rongkang Dong and Cuixin Yang and Zongqi He and Hao Xie and Kin-Man Lam},
journal= {arXiv preprint arXiv:2411.10130},
year = {2024}
}
备注
Accepted by ECCV 2024 AI for Visual Arts Workshop and Challenges, 18 pages, 7 figures