图像细节缺失:高频中最晚出现
计算机视觉与模式识别
2025-09-12 v3 机器学习
摘要
潜在生成模型在高保真图像合成方面取得了显著进展,通常采用两种训练流程:第一阶段通过学习的记号化器将图像压缩为潜在嵌入。在第一阶段中,生成质量强烈取决于这些潜在嵌入的表达性和优化程度。虽然已提出各种方法来学习有效的潜在表示,但生成的图像常常缺乏真实感,尤其是在具有锐利过渡的纹理区域,因为高频细节被损失。我们对现有最先进(SOTA)潜在记号化器进行了详细的频率分解,表明常规目标本身倾向于低频重建,往往以牺牲高频保真度为代价。我们的分析表明,这些潜在记号化器在优化过程中表现出对低频信息的偏好,从而导致输出过于平滑并产生视觉伪影,降低感知质量。为解决这一问题,我们提出一种基于小波的、频率感知的变分自编码器(FA-VAE)框架,显式地解耦了低频和高频组件的优化。这种解耦使得对细小纹理的重建得到改进,同时保持全局结构。此外,我们将我们的频率保持型潜在嵌入整合到SOTA潜在扩散模型中,实现更锐利更真实的图像生成。我们的做法弥合了当前潜在记号化器之间保真度差距,并强调了面向真实图像合成的频率感知优化的重要性,该工作对内容创建、神经渲染和医学影像等更广泛的应用具有意义。
引用
@article{arxiv.2509.05441,
title = {Missing Fine Details in Images: Last Seen in High Frequencies},
author = {Tejaswini Medi and Hsien-Yi Wang and Arianna Rampini and Margret Keuper},
journal= {arXiv preprint arXiv:2509.05441},
year = {2025}
}