中文

基于模态偏好的多模态鲁棒性量化与增强

计算机视觉与模式识别 2024-04-19 v2 多媒体

摘要

多模态模型已展现出有效整合来自各种来源信息的有前景的能力,然而同时,人们发现它们对普遍存在的扰动(如单模态攻击和缺失条件)很脆弱。为了应对这些扰动,人们高度期望获得鲁棒的多模态表示,这些表示在远离判别性多模态决策边界的位置。在本文中,与传统的经验研究不同,我们关注一个常用的联合多模态框架,并从理论上发现,更大的单模态表示间隔和更可靠的模态整合是实现更高鲁棒性的关键要素。这一发现可以进一步解释多模态鲁棒性的局限性,以及多模态模型通常容易受到对特定模态攻击的现象。此外,我们的分析揭示了模型对不同模态具有不同偏好这一普遍问题,是如何通过影响这些关键要素来限制多模态鲁棒性,并可能导致对特定模态的攻击高度有效的。受理论发现的启发,我们引入了一种称为可认证鲁棒多模态训练 (CRMT) 的训练过程,该方法可以减轻模态偏好的这种影响,并以可认证的方式显式调节关键要素,从而显著提高鲁棒性。与现有方法相比,我们的方法在性能和鲁棒性上均展现出显著提升。此外,我们的训练过程可以轻松扩展以增强其他鲁棒训练策略,突显了其可靠性与灵活性。

关键词

引用

@article{arxiv.2402.06244,
  title  = {Quantifying and Enhancing Multi-modal Robustness with Modality Preference},
  author = {Zequn Yang and Yake Wei and Ce Liang and Di Hu},
  journal= {arXiv preprint arXiv:2402.06244},
  year   = {2024}
}

备注

Accepted to ICLR 2024