通过隐空间特征向量偏移控制生成模型的输出
计算机视觉与模式识别
2024-02-28 v2
摘要
最先进的生成模型(例如 StyleGAN3 \cite{karras2021alias})通常基于从其隐空间采样的向量生成照片级真实图像。然而,控制输出的能力有限。在此我们提出一种利用生成图像的语义特征进行隐向量偏移以实现受控输出图像修改的新方法。在我们的方法中,我们使用一个预训练的 StyleGAN3 模型,以相对较高分辨率生成真实人脸图像。我们用一个卷积神经网络分类器(即 ResNet34)补充生成模型,该分类器训练用于从 CelebA 数据集对生成图像按二值人脸特征进行分类。我们的隐特征偏移器是一个神经网络模型,任务是将生成模型的隐向量偏移到指定的特征方向。我们针对多个人脸特征训练了隐特征偏移器,并在具有所需特征的图像生成数量上优于基线方法。为训练我们的隐特征偏移神经网络,我们设计了一个包含有某特征与无某特征的隐向量对的数据集。基于评估,我们得出结论:我们的隐特征偏移方法在 StyleGAN3 生成器的受控生成中是成功的。
引用
@article{arxiv.2311.08850,
title = {Controlling the Output of a Generative Model by Latent Feature Vector Shifting},
author = {Róbert Belanec and Peter Lacko and Kristína Malinovská},
journal= {arXiv preprint arXiv:2311.08850},
year = {2024}
}
备注
7 pages, presented on DISA2023 conference in Ko\v{s}ice, Source code: https://doi.org/10.5281/zenodo.10708459, Accepted: 7.8.2023. Published: 15.11.2023. This work was funded by the Horizon-Widera-2021 European Twinning project TERAIS G.A. n. 101079338