CoLA:条件丢弃与语言驱动的双模态显著物体检测
计算机视觉与模式识别
2024-07-10 v1
摘要
深度/热力学信息对利用常规 RGB 图像检测显著物体有益益。然而,在双模态显著物体检测(SOD)模型中,对噪声输入和模态缺失的鲁棒性却是关键但很少受到关注的议题。为解决此问题,我们提出包含两个核心组件的 CoLA(Conditional Dropout and Language-driven)框架:1)语言驱动质量评估(LQA):利用带有提示学习器的预训练视觉语言模型,LQA 在不需额外质量标注的情况下校准图像贡献,从而有效缓解噪声输入的影响。2)条件丢弃(CD):一种学习方法,用于增强在缺失模态情景下的模型适应性,同时保持完整模态下的性能。CD 作为一种可插拔式训练方案,将模态缺失视为条件,显著提升各种双模态 SOD 模型的整体鲁棒性。大量实验表明,所提方法在模态完整和模态缺失条件下均优于最先进的双模态 SOD 模型。我们将在接受后发布源代码。
引用
@article{arxiv.2407.06780,
title = {CoLA: Conditional Dropout and Language-driven Robust Dual-modal Salient Object Detection},
author = {Shuang Hao and Chunlin Zhong and He Tang},
journal= {arXiv preprint arXiv:2407.06780},
year = {2024}
}