BridgeDiff:用于虚拟试穿的人类观察与平面服装合成桥接
计算机视觉与模式识别
2026-03-11 v1 人工智能
摘要
虚拟试穿(VTOFF)旨在从穿着人物的图像中恢复规范平面服装表示,以实现标准化显示和后续虚拟试穿。先前方法常将VTOFF视为基于局部掩码或文本提示的直接图像翻译问题,忽略了穿身外观与平面布局之间的鸿沟。这种鸿沟常导致未观察区域的补全不一致和服装结构不稳定。我们提出BridgeDiff,一个基于扩散模型的框架,通过两个互补组件显式桥接人类中心的观察与平面服装合成。首先,Garment Condition Bridge Module(GCBM)构建服装线索表示,捕获全局外观和语义身份,使其能够在部分可见性下推断连续细节。其次,Flat Structure Constraint Module(FSCM)通过在所选去噪阶段引入Flat-Constraint Attention(FC-Attention),注入显式的平面服装结构先验,提升结构稳定性,超越文本唯一条件。广泛的实验表明,BridgeDiff在标准VTOFF基准上实现了最先进的性能,生成更高质量的平面服装重建,同时保留细粒度的外观和结构完整性。
引用
@article{arxiv.2603.09236,
title = {BridgeDiff: Bridging Human Observations and Flat-Garment Synthesis for Virtual Try-Off},
author = {Shuang Liu and Ao Yu and Linkang Cheng and Xiwen Huang and Li Zhao and Junhui Liu and Zhiting Lin and Yu Liu},
journal= {arXiv preprint arXiv:2603.09236},
year = {2026}
}
备注
33 pages, 16 figures