中文

FashionChameleon:迈向实时交互式人物-服装视频定制

计算机视觉与模式识别 2026-05-18 v1

摘要

以人为中心的视频定制,尤其是在服装层面,已展现出显著的商业价值。然而,现有方法无法支持低延迟和交互式的服装控制,而这对于电子商务和内容创作等应用至关重要。本文研究如何仅使用单件服装视频数据,在保持运动连贯性的同时实现交互式多服装视频定制。我们提出了 FashionChameleon,一个用于自回归视频生成中人物-服装定制的实时交互框架,用户可以在生成过程中交互式地切换服装。FashionChameleon 包含三项关键技术:(i) 我们不在多服装视频数据上训练,而是使用上下文学习在单个参考服装对上训练一个教师模型。通过保留图像到视频的训练范式,同时强制参考图像与服装图像不匹配,鼓励模型在单件服装切换时隐式地保持连贯性。(ii) 为了在生成过程中实现一致性和效率,我们引入了带上下文学习的流式蒸馏,它通过上下文教师强制微调模型,并通过梯度重加权分布匹配蒸馏提高外推一致性。(iii) 为了将模型扩展到交互式多服装视频定制,我们提出了免训练的 KV 缓存重调度,包括服装 KV 刷新、历史 KV 撤回和参考 KV 解耦,以实现服装切换同时保持运动连贯性。我们的 FashionChameleon 独特地支持交互式定制和一致的长视频外推,同时在单个 GPU 上实现 23.8 FPS 的实时生成,比现有基线快 30-180 倍。

关键词

引用

@article{arxiv.2605.15824,
  title  = {FashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customization},
  author = {Quanjian Song and Yefeng Shen and Mengting Chen and Hao Sun and Jinsong Lan and Xiaoyong Zhu and Bo Zheng and Liujuan Cao},
  journal= {arXiv preprint arXiv:2605.15824},
  year   = {2026}
}

备注

Project Page: https://quanjiansong.github.io/projects/FashionChameleon/