面向图文分类的鲁棒潜在表示微调
计算机视觉与模式识别
2024-06-17 v2 人工智能
多媒体
摘要
大型模型在计算机视觉和自然语言处理领域展现出了卓越的泛化能力。近期的研究致力于增强这些模型的多模态处理能力。然而,应对某一模态缺失场景所带来的挑战仍然是一个重大障碍。针对这一问题,我们提出了一种面向大型模型的鲁棒潜在表示微调方法。具体来说,我们的方法引入了一个模态潜在翻译模块,以最大化模态间的相关性,从而产生鲁棒的表示。随后,采用一个新设计的融合模块来促进模态间的信息交互。在此框架内,共同语义在训练过程中得到精炼,即使缺失某一模态也能实现鲁棒的性能。重要的是,我们的方法保持图像和文本基础模型的冻结状态,以保留它们通过大规模预训练获得的能力。我们在多个公开数据集上进行了实验,结果突显了我们提出方法的有效性。
引用
@article{arxiv.2406.06048,
title = {Robust Latent Representation Tuning for Image-text Classification},
author = {Hao Sun and Yu Song},
journal= {arXiv preprint arXiv:2406.06048},
year = {2024}
}