重新思考非配对图像到图像翻译中内容约束的范式
计算机视觉与模式识别
2024-01-09 v3
摘要
在非配对设定下,图像到图像翻译(I2I)任务缺乏充分的内容约束,基于GAN的方法通常易出现模型坍塌。现有方案可分为两类:基于重建的与基于孪生网络的。前者要求变换后或变换中的图像能完美还原回原图像,这有时过于严格并限制了生成性能。后者将原图与生成图输入特征提取器并匹配其输出,效率不足,且通用特征提取器不易获得。本文提出EnCo,一种简单而高效的内容保持方法,通过约束生成器编码器与解码器同阶段块级特征在潜空间中的表征相似性来实现。对于相似性函数,我们采用简单的MSE损失而非当前I2I任务中广泛使用的对比损失。得益于该设计,EnCo训练极为高效,同时编码器特征对解码产生更积极的作用,带来更令人满意的生成结果。此外,我们重新思考判别器在块采样中的作用,提出判别注意力引导(DAG)块采样策略以替代随机采样。DAG无参数且仅需可忽略的计算开销,却显著提升了模型性能。在多数据集上的大量实验证明了EnCo的有效性与优势,我们相较以往方法取得了多项state-of-the-art。代码见 https://github.com/XiudingCai/EnCo-pytorch。
引用
@article{arxiv.2211.10867,
title = {Rethinking the Paradigm of Content Constraints in Unpaired Image-to-Image Translation},
author = {Xiuding Cai and Yaoyao Zhu and Dong Miao and Linjie Fu and Yu Yao},
journal= {arXiv preprint arXiv:2211.10867},
year = {2024}
}
备注
Accepted by AAAI 2024