GeoPos:一种增强卷积神经网络图像合成中细粒度细节的最小位置编码
计算机视觉与模式识别
2024-12-06 v2 人工智能
机器学习
摘要
图像生成模型近十年来一直难以重现复杂的几何特征,例如人手和手指中的细节。尽管通过增大模型规模和多样化训练数据集取得了一定进展,但从去噪扩散模型到生成对抗网络(GAN),这一问题在所有模型中依然普遍存在,表明底层架构存在根本性缺陷。本文中,我们展示了如何通过为卷积层提供一个包含相对n维笛卡尔坐标系的单一输入通道来增强其几何能力,从而缓解这一问题。我们证明,这极大地提高了扩散模型、GAN和变分自编码器(VAE)生成的图像质量。
引用
@article{arxiv.2401.01951,
title = {GeoPos: A Minimal Positional Encoding for Enhanced Fine-Grained Details in Image Synthesis Using Convolutional Neural Networks},
author = {Mehran Hosseini and Peyman Hosseini},
journal= {arXiv preprint arXiv:2401.01951},
year = {2024}
}
备注
Accepted at WACV 2025. Contains 19 pages, 15 figures, and 9 tables