中文

ReDirTrans:用于视线与头部重定向的潜空间到潜空间翻译

计算机视觉与模式识别 2023-12-01 v1

摘要

基于学习的视线估计方法需要大量带有精确视线标注的训练数据。面对视线数据采集与标注的严苛需求,已有若干图像合成方法被提出,其能在给定条件下精确重定向视线方向。然而,这些方法侧重于仅改变仅包含眼睛或受限低分辨率(小于 128×128128\times128)人脸图像的视线方向,以大幅降低头发等其他属性的干扰,这限制了应用场景。为应对该局限,我们提出了一种可移植网络 ReDirTrans,以可解释方式实现潜空间到潜空间的翻译,用于重定向视线方向与头部朝向。ReDirTrans 仅将输入潜向量投影至目标属性嵌入,并使用指定的俯仰与偏航值重定向这些嵌入。随后,初始与编辑后的嵌入被投影回(反投影)初始潜空间作为残差,通过减法和加法修改输入潜向量,分别表示旧状态移除与新状态添加。仅投影目标属性以及用于状态替换的减加操作,从根本上减轻了其他属性及潜向量分布的影响。因此,通过将 ReDirTrans 与预训练固定的 e4e-StyleGAN 对结合,我们创建了 ReDirTrans-GAN,其能在 1024×10241024\times1024 分辨率的全脸图像中精确重定向视线,同时保留身份、表情和发型等其他属性。此外,我们利用重定向样本作为数据集增广,展示了对下游基于学习的视线估计任务的改进。

关键词

引用

@article{arxiv.2305.11452,
  title  = {ReDirTrans: Latent-to-Latent Translation for Gaze and Head Redirection},
  author = {Shiwei Jin and Zhen Wang and Lei Wang and Ning Bi and Truong Nguyen},
  journal= {arXiv preprint arXiv:2305.11452},
  year   = {2023}
}