面向模态缺失下鲁棒视觉识别的协同提示
计算机视觉与模式识别
2025-07-14 v2
摘要
大规模多模态模型通过利用大量成对的多模态训练数据,在各种视觉识别任务中展现出了卓越的性能。然而,在实际应用中,缺失或不完整的模态输入往往会导致显著的性能下降。近期的研究侧重于基于提示的策略来解决这一问题;然而,现有方法受到两大局限性的阻碍:(1)静态提示缺乏适应不同缺失数据条件的灵活性,以及(2)当关键模态缺失时,基本的提示微调方法难以确保可靠的性能。为了应对这些挑战,我们提出了一种新型协同提示框架,用于模态缺失下的鲁棒视觉识别。所提出的SyP引入了两项关键创新:(I)动态适配器,它计算自适应缩放因子以动态生成提示,取代静态参数以实现灵活的多模态适应;以及(II)协同提示策略,它结合静态和动态提示以平衡跨模态的信息,确保即使在关键模态缺失时也能进行鲁棒推理。所提出的SyP在三个广泛使用的视觉识别数据集上取得了优于现有方法的显著性能提升,展示了在不同缺失率和条件下的鲁棒性。大量的实验和消融研究验证了其在处理模态缺失方面的有效性,突显了其卓越的适应性和可靠性。
引用
@article{arxiv.2507.07802,
title = {Synergistic Prompting for Robust Visual Recognition with Missing Modalities},
author = {Zhihui Zhang and Luanyuan Dai and Qika Lin and Yunfeng Diao and Guangyin Jin and Yufei Guo and Jing Zhang and Xiaoshuai Hao},
journal= {arXiv preprint arXiv:2507.07802},
year = {2025}
}