中文

GS-VTON:基于高斯溅射的可控 3D 虚拟试穿

计算机视觉与模式识别 2024-10-08 v1

摘要

基于扩散的 2D 虚拟试穿(VTON)技术最近表现出强大的性能,而 3D VTON 的开发却滞后于人们的期望。尽管近期在文本引导的 3D 场景编辑方面取得了进展,但将 2D VTON 集成到这些管道中以实现逼真的 3D VTON 仍具有挑战性。其原因有两个:其一,文本提示无法提供足够细节来描述服装;其二,来自同一 3D 场景不同视角生成的 2D VTON 结果在一致性和空间关系方面缺乏连贯性,常导致外观不一致和几何畸变。为解决这些问题,我们提出了一种图像引导的 3D VTON 方法(命名为 GS-VTON),通过利用 3D 高斯溅射(3DGS)作为 3D 表示,使我们能够将预训练的 2D VTON 知识迁移到 3D 中,同时提升跨视角一致性。(1)具体而言,我们提出了一种个性化扩散模型,利用低秩适应(LoRA)微调将个性化信息融入预训练的 2D VTON 模型。为实现有效的 LoRA 训练,我们引入一种参考驱动的图像编辑方法,使多个视角的图像能够同步编辑并保持一致性。(2)进一步,我们提出了一种面向人格的 3DGS 编辑框架,以实现高效编辑,同时保持跨视角外观一致性和高质量 3D 几何。(3)此外,我们建立了一个新的 3D VTON 基准测试集 3D-VTONBench,旨在支持 3D VTON 的全面定性与定量评估。通过大量实验和与现有方法的比较分析,所提出的方法 \OM 已在保真度和编辑能力方面显著优于其他方法,验证了其在 3D VTON 领域的有效性。

关键词

引用

@article{arxiv.2410.05259,
  title  = {GS-VTON: Controllable 3D Virtual Try-on with Gaussian Splatting},
  author = {Yukang Cao and Masoud Hadi and Liang Pan and Ziwei Liu},
  journal= {arXiv preprint arXiv:2410.05259},
  year   = {2024}
}

备注

21 pages, 11 figures