中文

SARGAN:基于空间注意力残差的人脸表情操控方法

计算机视觉与模式识别 2023-03-31 v1

摘要

基于编码器-解码器的架构已广泛用于生成对抗网络的人脸操控生成器中。然而,我们观察到当前架构无法恢复输入图像的颜色、丰富的面部细节(如肤色或纹理),并且会引入伪影。本文提出一种名为 SARGAN 的新方法,从三个角度解决上述局限。首先,我们采用基于空间注意力的残差块替代普通残差块,以恰当捕获待改变的表达相关特征,同时保持其他特征不变。其次,我们利用对称编码器-解码器网络在多尺度上关注面部特征。第三,我们提出以残差连接训练完整网络,从而减轻生成器生成输入人脸图像的压力,通过直接将输入图像馈送至生成器末端来产生期望表情。定性与定量实验结果均表明,我们所提模型显著优于 SOTA 方法。此外,现有模型需要大得多的数据集进行训练,且在分布外图像上性能下降。相比之下,SARGAN 可在较小的人脸表情数据集上训练,并对包括人物照片、肖像、头像和雕像在内的分布外图像具有良好的泛化能力。

关键词

引用

@article{arxiv.2303.17212,
  title  = {SARGAN: Spatial Attention-based Residuals for Facial Expression Manipulation},
  author = {Arbish Akram and Nazar Khan},
  journal= {arXiv preprint arXiv:2303.17212},
  year   = {2023}
}