中文

DPL:解耦原型学习以增强视觉语言变换器对缺失模态的鲁棒性

机器学习 2025-11-18 v2 计算机视觉与模式识别

摘要

当输入模态(例如图像)缺失时,视觉语言变换器的性能会急剧下降,因为模型被迫使用不完整的信息做出预测。现有的缺失感知提示方法虽有助于减缓这种下降,但仍依赖于常规预测头(例如全连接层),无论哪种模态存在或缺失,都以相同方式计算类别得分。我们引入解耦原型学习 (DPL),一种新的预测头架构,显式地根据观察到的输入模态调整其决策过程。对于每个类别,DPL 选择一组特定于当前缺失模态情况(图像缺失、文本缺失或混合缺失)的原型。然后,将每个原型分解为图像特定组件和文本特定组件,使头部能够根据实际存在的信息做出决策。这种自适应设计允许 DPL 更有效地处理缺失模态的输入,同时完全兼容现有的基于提示的框架。在 MM-IMDb、UPMC Food-101 和 Hateful Memes 上的大量实验表明,DPL 在各种广泛使用的多模态图像-文本数据集和各种缺失情况下均优于最先进的方法。

关键词

引用

@article{arxiv.2505.08283,
  title  = {DPL: Decoupled Prototype Learning for Enhancing Robustness of Vision-Language Transformers to Missing Modalities},
  author = {Jueqing Lu and Yuanyuan Qi and Xiaohao Yang and Shuaicheng Niu and Fucai Ke and Shujie Zhou and Wei Tan and Jionghao Lin and Wray Buntine and Hamid Rezatofighi and Lan Du},
  journal= {arXiv preprint arXiv:2505.08283},
  year   = {2025}
}

备注

Updates to v1. Added new coauthors and extended the experimental section