面向不平衡小样本分类的语言引导高光谱图像合成:基于半监督条件扩散模型
计算机视觉与模式识别
2025-12-30 v4
摘要
数据增强有效地解决了高光谱图像分类(HSIC)中的不平衡小样本数据(ISSD)问题。虽然大多数方法局限于潜在空间中的特征扩展,但鲜有利用文本驱动生成以创建真实且多样化样本。近期,文本引导扩散模型因能够基于文本提示生成高度多样且高质量的图像而受到广泛关注。为此,本文提出Txt2HSI-LDM(VAE),一种新型语言引导高光谱图像合成方法,用于解决HSIC中的ISSD问题。该方法使用去噪扩散模型,迭代去除高斯噪声以生成以文本描述为条件的高光谱样本。首先,为解决高光谱数据的高维问题,设计了通用变分自编码器(VAE),将数据映射到低维潜在空间,提供稳定的特征并降低扩散模型的推理复杂度。其次,设计了半监督扩散模型,充分利用未标注数据。采用随机多边形空间裁剪(RPSC)和潜在特征不确定性估计(LF-UE)来模拟混合程度不同的情形。最后,VAE以语言条件为输入,从扩散模型生成的潜在空间解码HSI。在实验中,我们全面评估了合成样本在统计特征和数据分布(2D-PCA空间)中的有效性。此外,可视化了像素级别的视觉-语言跨注意力,以证明所提出的模型能够捕获生成数据的空间布局和几何结构。实验结果表明,所提出的Txt2HSI-LDM(VAE)在经典基线模型、SOTA的CNN和半监督方法上均取得了优异性能。
引用
@article{arxiv.2502.19700,
title = {Language-Informed Hyperspectral Image Synthesis for Imbalanced-Small Sample Classification via Semi-Supervised Conditional Diffusion Model},
author = {Yimin Zhu and Lincoln Linlin Xu},
journal= {arXiv preprint arXiv:2502.19700},
year = {2025}
}