中文

Dress-ED:面向虚拟试穿与试脱的指令导向编辑

计算机视觉与模式识别 2026-04-15 v2

摘要

最近的虚拟试穿(VTON)和虚拟试脱(VTOFF)技术显著提升了时尚合成和服装重建的照片级真实感,但现有数据集仍为静态,缺乏面向可控和交互式时尚生成的指令驱动编辑能力。本文引入 Dress Editing Dataset (Dress-ED),首个大规模基准,统一框架内集成 VTON、VTOFF 与文本导向服装编辑。Dress-ED 的每个样本包含服装店中的服装图像、对应穿着该服装的人物图像、其编辑后的版本,以及自然语言指令。我们通过完全自动化的多模态管道构建数据集,集成基于 MLLM 的服装理解、扩散模型编辑和 LLM 指导的验证,Dress-ED 包含超过 146k 个经验证的四元组,覆盖三类服装和七种编辑类型,包括外观编辑(如颜色、图案、材料)和结构编辑(如袖长、领口形状)。基于该基准,我们进一步提出统一的多模态扩散框架,联合推理语言指令与视觉服装线索,可作为指令驱动 VTON 和 VTOFF 的强基准。数据集和代码将公开释放。项目页面:https://furio1999.github.io/Dress-ED/

关键词

引用

@article{arxiv.2603.22607,
  title  = {Dress-ED: Instruction-Guided Editing for Virtual Try-On and Try-Off},
  author = {Fulvio Sanguigni and Davide Lobba and Bin Ren and Marcella Cornia and Nicu Sebe and Rita Cucchiara},
  journal= {arXiv preprint arXiv:2603.22607},
  year   = {2026}
}

备注

Project page: https://furio1999.github.io/Dress-ED/