基于扩散模型的 3D 纹理引导的一致视频试穿
计算机视觉与模式识别
2025-04-25 v1
摘要
视频试穿用于替换视频中的服装为目标服饰。现有方法在处理复杂服装图案和多样化身体姿态时,难以生成高质量且在时间上一致的结果。我们提出了 3DV-TON,一种新型基于扩散模型的框架,用于生成高保真且在时间上一致的视频试穿结果。我们的方法采用生成的可动画纹理 3D 网格作为显式的帧级引导,从而缓解了模型过于关注外观保真度而牺牲运动一致性的问题。这通过在整个视频序列中直接参考一致的服饰纹理运动来实现。该方法包含用于生成动态 3D 引导的自适应流程:(1) 选择关键帧进行初始 2D 图像试穿,随后 (2) 重建并动画化与原始视频姿态同步的纹理 3D 网格。我们进一步引入了稳健的矩形遮罩策略,成功缓解了在动态人体和服饰运动期间因信息泄露导致的伪影传播问题。为推动视频试穿研究,我们引入了 HR-VVT,一个包含 130 个具有多样化服装类型和场景的高分辨率基准数据集。定量和定性结果均显示我们优于现有方法。项目页面链接为 https://2y7c3.github.io/3DV-TON/
引用
@article{arxiv.2504.17414,
title = {3DV-TON: Textured 3D-Guided Consistent Video Try-on via Diffusion Models},
author = {Min Wei and Chaohui Yu and Jingkai Zhou and Fan Wang},
journal= {arXiv preprint arXiv:2504.17414},
year = {2025}
}
备注
Project page: https://2y7c3.github.io/3DV-TON/