中文

UniFit:基于 MLLM 指导的通用虚拟试穿

计算机视觉与模式识别 2026-02-11 v2

摘要

图像基准虚拟试穿 (VTON) 旨在合成某人穿指定服装的照片逼真图像。尽管取得了显著进展,但构建能够灵活处理多样且复杂任务的通用 VTON 框架仍是重大挑战。近期方法探索受文本指令指导的多任务 VTON 框架,但仍面临两个关键局限:(1) 文本指令与参考图像之间的语义差距,(2) 复杂场景下的数据稀缺。为此,我们提出 UniFit,一个由多模态大语言模型 (MLLM) 驱动的通用 VTON 框架。具体而言,我们引入 MLLM 指导语义对齐模块 (MGSA),该模块集成 MLLM 和一组可学习查询。通过施加语义对齐损失,MGSA 捕获跨模态语义关系,为生成过程提供连贯且明确的语义指导,从而减少语义差距。此外,通过构建分阶段渐进训练策略和自生成功能管线,UniFit 能够从有限数据中学习复杂任务。大量实验表明,UniFit 不仅支持广泛的 VTON 任务,包括多服装和模型到模型试穿,还实现了最新性能。源代码和预训练模型已公开:https://github.com/zwplus/UniFit

关键词

引用

@article{arxiv.2511.15831,
  title  = {UniFit: Towards Universal Virtual Try-on with MLLM-Guided Semantic Alignment},
  author = {Wei Zhang and Yeying Jin and Xin Li and Yan Zhang and Xiaofeng Cong and Cong Wang and Fengcai Qiao and zhichao Lian},
  journal= {arXiv preprint arXiv:2511.15831},
  year   = {2026}
}

备注

accepted to AAAI-2026