中文

Tunnel Try-on:挖掘时空隧道以实现高质量视频虚拟试穿

计算机视觉与模式识别 2024-04-29 v1

摘要

视频试穿是一项具有挑战性的任务,在以往的工作中尚未得到很好的解决。主要障碍在于同时保留服装细节和对连贯运动进行建模。面对这些困难,我们通过提出一个基于扩散的框架“Tunnel Try-on”来解决视频试穿问题。核心思想是在输入视频中挖掘一个“聚焦隧道”,提供服装区域周围的特写镜头。我们放大隧道内的区域以更好地保留服装的精细细节。为了生成连贯的运动,我们首先利用 Kalman filter 在聚焦隧道中构建平滑裁剪,并将隧道的位置嵌入注入到注意力层中以提高生成视频的连续性。此外,我们开发了一个环境编码器来提取隧道之外的上下文信息作为补充线索。配备了这些技术,Tunnel Try-on 保留了服装的精细细节并合成了稳定平滑的视频。展示了显著的进步,Tunnel Try-on 可被视为迈向视频虚拟试穿商业级应用的首个尝试。

关键词

引用

@article{arxiv.2404.17571,
  title  = {Tunnel Try-on: Excavating Spatial-temporal Tunnels for High-quality Virtual Try-on in Videos},
  author = {Zhengze Xu and Mengting Chen and Zhao Wang and Linyu Xing and Zhonghua Zhai and Nong Sang and Jinsong Lan and Shuai Xiao and Changxin Gao},
  journal= {arXiv preprint arXiv:2404.17571},
  year   = {2024}
}

备注

Project Page: https://mengtingchen.github.io/tunnel-try-on-page/