中文

MGAug:图像形变潜在空间中的多模态几何增强

计算机视觉与模式识别 2025-03-11 v3

摘要

几何变换已被广泛用于增加训练图像的数量。现有方法通常假设图像间的底层变换服从单峰分布,这在数据呈现多峰分布时限制了它们的性能。在本文中,我们提出了一种新颖的模型——多模态几何增强(MGAug),首次在几何形变的多模态潜在空间中生成增强变换。为实现这一点,我们首先开发了一个深度网络,将微分同胚变换(即微分同胚)的潜在几何空间学习嵌入到变分自编码器(VAE)中。在微分同胚的切空间中构建了多元高斯混合模型,并以此作为先验来近似图像变换的隐藏分布。然后,我们从学习到的 VAE 多模态潜在空间中随机采样变换并以此形变图像,从而增强原始训练数据集。为了验证我们模型的效率,我们将该增强策略与两个不同的特定领域任务进行联合学习:二维合成数据集上的多类分类和真实三维脑磁共振图像(MRI)上的分割。我们还将 MGAug 与基于最先进变换的图像增强算法进行了比较。实验结果表明,我们提出的方法显著提高了预测精度,优于所有基线方法。我们的代码已在 https://github.com/tonmoy-hossain/MGAug 公开发布。

关键词

引用

@article{arxiv.2312.13440,
  title  = {MGAug: Multimodal Geometric Augmentation in Latent Spaces of Image Deformations},
  author = {Tonmoy Hossain and Miaomiao Zhang},
  journal= {arXiv preprint arXiv:2312.13440},
  year   = {2025}
}