MixerGAN:一种基于MLP的非配对图像到图像翻译架构
计算机视觉与模式识别
2021-08-20 v2
摘要
尽管基于注意力的Transformer网络在几乎所有语言任务中都取得了无与伦比的成功,但图像中大量的令牌(像素)数量以及二次方的激活内存占用,使其在计算机视觉问题中难以应用。因此,尽管语言到语言翻译已被Transformer模型所革新,卷积网络仍是图像到图像翻译事实上的解决方案。近期提出的MLP-Mixer架构缓解了与基于注意力的网络相关的一些计算问题,同时仍保留了使Transformer模型备受青睐的长程连接。利用这一内存高效的注意力替代方案,我们提出了一种用于非配对图像到图像翻译的新探索性模型,称为MixerGAN:一种更简洁的基于MLP的架构,它考虑像素间的长距离关系,而无需昂贵的注意力机制。定量与定性分析表明,MixerGAN相较于先前的基于卷积的方法取得了具有竞争力的结果。
引用
@article{arxiv.2105.14110,
title = {MixerGAN: An MLP-Based Architecture for Unpaired Image-to-Image Translation},
author = {George Cazenavette and Manuel Ladron De Guevara},
journal= {arXiv preprint arXiv:2105.14110},
year = {2021}
}
备注
Under Review for WACV 2022