GMapLatent:基于几何映射的潜在空间几何对齐
计算机视觉与模式识别
2025-04-01 v1 人工智能
摘要
基于编码器-解码器 AI 架构的跨域生成模型在生成逼真图像方面备受关注,其中域对齐对于生成精度至关重要。通常情况下,域对齐方法直接处理初始分布;然而,分布不匹配或混合聚类会导致解码器出现模式坍缩和混合问题,进而损害模型的泛化能力。本文提出一种创新的跨域对齐和生成模型,引入基于几何映射的标准化潜在空间表示,以严格而精确的方式对齐跨域潜在空间,从而避免编码器-解码器生成架构中的模式坍缩和混合问题。我们称该模型为 GMapLatent。该方法的核心在于通过聚类装饰潜在空间的标准参数化,实现潜在空间的无缝对齐,同时施加严格的聚类对应约束。具体步骤为:(1) 通过组成重心平移、最优传输合并和受约束调和映射,将潜在空间转换为标准参数域;(2) 在标准参数域上执行受聚类约束的几何注册。该过程实现了新转换后潜在空间之间的双射(一对一且满射)映射,生成精确的聚类配对对齐。随后通过对齐后的潜在空间嵌入编码器-解码器管道实现跨域生成。在灰度图像和彩色图像上的实验验证了 GMapLatent 的有效性、效率和适用性,证明该模型在现有模型中具有优越性能。
引用
@article{arxiv.2503.23407,
title = {GMapLatent: Geometric Mapping in Latent Space},
author = {Wei Zeng and Xuebin Chang and Jianghao Su and Xiang Gu and Jian Sun and Zongben Xu},
journal= {arXiv preprint arXiv:2503.23407},
year = {2025}
}