基于 Vision Transformer 的空间 GAN 纹理图像合成
计算机视觉与模式识别
2025-05-09 v2 人工智能
摘要
纹理合成是计算机视觉中的基础任务,旨在生成视觉上真实且结构连贯的纹理,以适用于从图形学到科学仿真的广泛应用场景。虽然传统方法如平铺和基于补丁的技术在处理复杂纹理时常常力不足,但近期深度学习技术的突破已推动了该领域的发展。本文提出了 ViT-SGAN,一种新型混合模型,将 Vision Transformer(ViT)与空间生成对抗网络(SGAN)融合,以解决前述方法的局限性。通过将特定的纹理描述符(如均值-方差 mu、sigma 和 textons)融入 ViT 的自注意力机制,模型实现了卓越的纹理合成效果。该方法提升了模型捕捉复杂空间依赖关系的能力,进而实现了对常规与非规则纹理的显著提升。通过 FID、IS、SSIM 和 LPIPS 等指标的对比实验,结果表明 ViT-SGAN 在纹理多样性和真实性方面均优于当前最先进的模型。
引用
@article{arxiv.2502.01842,
title = {Texture Image Synthesis Using Spatial GAN Based on Vision Transformers},
author = {Elahe Salari and Zohreh Azimifar},
journal= {arXiv preprint arXiv:2502.01842},
year = {2025}
}
备注
Preprint