中文

InstructVTON:基于填充的虚拟试穿中的最优自动遮罩与自然语言引导的交互式风格控制

计算机视觉与模式识别 2025-09-26 v1 人工智能

摘要

我们提出了 InstructVTON,这是一个遵循指令的交互式虚拟试穿系统,允许用户通过自然语言在单件或多件服装上进行细粒度和复杂的风格控制。虚拟试穿的高效且可扩展的数学表述将问题形式化为图像引导或图像条件的填充任务。这种基于填充的虚拟试穿模型通常使用二值遮罩来控制生成布局。产生具有理想结果的遮罩较为困难,需要背景知识,可能因模型而异,某些情况下甚至不可能(例如,在穿着长袖衬衫的人员上尝试 "袖口卷起" 风格的长袖衬衫,其中遮罩必然覆盖整个袖子)。InstructVTON 利用视觉语言模型(VLM)和图像分割模型进行自动化二值遮罩生成。这些遮罩基于用户提供的图像和自由文本风格指令生成。InstructVTON 通过消除精确绘制遮罩的需求,并自动执行无法仅通过遮罩-based 虚拟试穿模型实现的试穿场景的多轮图像生成,从而简化了最终用户的体验。我们展示了 InstructVTON 可与现有的虚拟试穿模型集成,以实现带有风格控制的领先结果。

关键词

引用

@article{arxiv.2509.20524,
  title  = {InstructVTON: Optimal Auto-Masking and Natural-Language-Guided Interactive Style Control for Inpainting-Based Virtual Try-On},
  author = {Julien Han and Shuwen Qiu and Qi Li and Xingzi Xu and Mehmet Saygin Seyfioglu and Kavosh Asadi and Karim Bouyarmane},
  journal= {arXiv preprint arXiv:2509.20524},
  year   = {2025}
}

备注

Submitted to CVPR 2025 and Published at CVPR 2025 AI for Content Creation workshop