通过扩散模型统一视觉与语义特征空间以实现跨模态对齐
计算机视觉与模式识别
2024-07-29 v1 人工智能
摘要
图像分类模型在现实应用中常因图像信息的变化而表现不稳定,这种变化由主体物体的不同视角和光照差异引起。为缓解这些挑战,现有研究通常通过融合与视觉数据相匹配的额外模态信息来正则化模型的学习过程,从而从复杂的图像区域中提取高质量的视觉特征。具体而言,在多模态学习领域,跨模态对齐被视为一种有效策略,通过学习视觉特征和语义特征的领域一致潜在特征空间来实现不同模态信息的和谐。然而,这种方法可能因多模态信息的异质性(如特征分布和结构的差异)而受到限制。为解决此问题,本文引入一种多模态对齐与重构网络(MARNet),旨在增强模型对视觉噪声的抗干扰能力。重要的是,MARNet包含一个跨模态扩散重构模块,用于平滑且稳定地跨域融合信息。在两个基准数据集 Vireo-Food172 和 Ingredient-101 上的实验表明,MARNet 有效改善了模型提取的图像信息质量。这是一个即插即用的框架,可快速集成到各种图像分类框架中,从而提升模型性能。
引用
@article{arxiv.2407.18854,
title = {Unifying Visual and Semantic Feature Spaces with Diffusion Models for Enhanced Cross-Modal Alignment},
author = {Yuze Zheng and Zixuan Li and Xiangxian Li and Jinxing Liu and Yuqing Wang and Xiangxu Meng and Lei Meng},
journal= {arXiv preprint arXiv:2407.18854},
year = {2024}
}