中文

基于空间约束的文本引导眼镜操纵

计算机视觉与模式识别 2023-07-25 v2

摘要

眼镜虚拟试戴是指将不同形状与风格的眼镜放置到人脸图像上而无需实际试戴。尽管现有方法已展示出令人印象深刻的成果,但眼镜风格种类有限且交互并不总是直观或高效。为应对这些局限,我们提出一种文本引导眼镜操纵方法,分别基于二值掩码和文本来控制眼镜的形状与风格。具体而言,我们引入掩码编码器提取掩码条件,以及可实现文本与掩码条件同时注入的调制模块。该设计允许基于文本描述与空间约束对眼镜外观进行细粒度控制。我们的方法包含解耦映射器与解耦策略以保留无关区域,从而实现更好的局部编辑。我们采用两阶段训练方案来处理不同模态条件收敛速度的差异,成功控制眼镜的形状与风格。大量对比实验与消融分析证明了我们的方法在实现多样眼镜风格的同时保留无关区域的有效性。

关键词

引用

@article{arxiv.2304.12539,
  title  = {Text-guided Eyeglasses Manipulation with Spatial Constraints},
  author = {Jiacheng Wang and Ping Liu and Jingen Liu and Wei Xu},
  journal= {arXiv preprint arXiv:2304.12539},
  year   = {2023}
}

备注

Revised version: add some experiments