Dress&Dance:随意穿衣与舞动 - 技术预览
计算机视觉与模式识别
2025-08-29 v1 机器学习
摘要
我们提出 Dress&Dance,一个视频扩散框架,可生成用户穿着所需服装且动作符合给定参考视频的 5 秒时长、24 帧/秒、分辨率为 1152x720 的高质量虚拟试穿视频。该方法仅需单张用户图片,支持各种上衣、下装及单件服装,以及同时进行上下装试穿。框架的关键在于 CondNet,即一种新型条件网络,利用注意力机制统一多模态输入(文本、图像和视频),从而提升服装配准和动作保真度。CondNet 在异构训练数据上进行训练,结合有限的视频数据和更大规模可获取的图像数据集,以多阶段渐进方式进行训练。Dress&Dance 在现有开源和商业解决方案中表现优异,实现了高质量且灵活的试穿体验。
引用
@article{arxiv.2508.21070,
title = {Dress&Dance: Dress up and Dance as You Like It - Technical Preview},
author = {Jun-Kun Chen and Aayush Bansal and Minh Phuoc Vo and Yu-Xiong Wang},
journal= {arXiv preprint arXiv:2508.21070},
year = {2025}
}
备注
Project Page: https://immortalco.github.io/DressAndDance/