高光谱自编码器用于高保真图像重建与生成
计算机视觉与模式识别
2026-05-12 v2 人工智能
机器学习
摘要
近期研究探索了使用预训练视觉基础模型(如 DINO)用于生成式自编码器,显示出强大的生成性能。然而,现有方法常因丢失高频细节而受限于重建保真度。在本工作中,我们提出了\textbf{\em 高光谱自编码器(Hyperspherical Autoencoder, HAE)},以框架性地桥接语义表示与像素级重建。我们的关键洞察在于,虽然对比表示中的语义信息主要是方向性的,但强制严格的幅度匹配会阻碍细粒度细节的保留。为此,我们引入\textbf{\em 方向特征对齐(Directional Feature Alignment)}目标,以保持语义一致性,同时允许灵活的特征幅度以实现细节保留,并引入\textbf{\em 分层卷积补丁嵌入(Hierarchical Convolutional Patch Embedding)}模块以增强局部结构保持。此外,观察到基于 SSL 的表示本质上位于光谱球面上,我们采用\textbf{\em 黎布利流匹配(Riemannian Flow Matching)}在该球面潜在流形上直接训练扩散变换器(Diffusion Transformer, DiT)。值得注意的是,我们的流形感知 DiT 显示出高度有效的收敛,实现了异常值的 gFID 为 \textbf{1.96},重建 rFID 为 \textbf{0.78},以及 PSNR 为 \textbf{25.2} dB,验证了我们流形感知方法的优势。
引用
@article{arxiv.2601.22904,
title = {Hyperspherical Autoencoder for High-Fidelity Image Reconstruction and Generation},
author = {Hun Chang and Byunghee Cha and Jong Chul Ye},
journal= {arXiv preprint arXiv:2601.22904},
year = {2026}
}
备注
22 pages, and 20 figures