LSAP:重新思考 GAN 潜空间中的反演保真度、感知性与可编辑性
计算机视觉与模式识别
2025-11-21 v3 人工智能
机器学习
摘要
随着图像反演研究的推进,该过程通常分为两个阶段。第一步是图像嵌入,涉及使用编码器或优化过程嵌入图像并获得其对应的潜码。第二阶段称为结果精炼,进一步改善反演与编辑结果。尽管该精炼阶段大幅提升了重建保真度,感知性与可编辑性基本保持不变,且高度依赖于第一阶段得到的潜码。因此,一个关键挑战在于获得在保持重建保真度的同时提升感知性与可编辑性的潜码。在本工作中,我们首先揭示这两种特性与反演潜码和合成分布之间对齐(或失对齐)程度密切相关。基于这一洞见,我们提出\textbf{潜空间对齐反演范式(LSAP)},其集成了一种评估指标与统一的反演解决方案。具体而言,我们引入\textbf{归一化风格空间( 空间)}与\textbf{归一化风格空间余弦距离(NSCD)}来量化反演方法的失对齐程度。此外,我们的范式可针对基于编码器和基于优化的嵌入进行优化,提供一致的对齐框架。跨多个领域的广泛实验表明,NSCD 有效捕捉感知与可编辑特征,且我们的对齐范式在两个反演阶段均达到最先进(state-of-the-art)性能。
引用
@article{arxiv.2209.12746,
title = {LSAP: Rethinking Inversion Fidelity, Perception and Editability in GAN Latent Space},
author = {Xuekun Zhao and Pu Cao and Xiaoya Yang and Mingjian Zhang and Lu Yang and Qing Song},
journal= {arXiv preprint arXiv:2209.12746},
year = {2025}
}
备注
under review