中文

分布偏移下多模态图像-文本模型的鲁棒性基准测试

计算机视觉与模式识别 2024-01-22 v3

摘要

多模态图像-文本模型在过去几年中表现出卓越的性能。然而,在将其应用于实际场景之前,评估其针对分布偏移的鲁棒性至关重要。在本工作中,我们研究了 12 个流行的开源图像-文本模型在五种任务(图像-文本检索、视觉推理、视觉蕴含、图像描述生成和文本到图像生成)下受常见扰动时的鲁棒性。具体而言,我们通过在现有数据集上施加 17 种图像扰动和 16 种文本扰动技术,提出了若干新的多模态鲁棒性基准。我们观察到多模态模型对图像和文本扰动均不鲁棒,尤其对图像扰动。在测试的扰动方法中,字符级扰动构成了文本最严重的分布偏移,而缩放模糊是图像数据最严重的偏移。我们还引入了两个新的鲁棒性度量(\textbf{MMI} 表示多模态影响分数,\textbf{MOR} 表示缺失对象率)以恰当评估多模态模型。我们希望这项广泛的研究能为鲁棒多模态模型的发展提供新的方向。更多细节见项目网页:\url{https://MMRobustness.github.io}。

关键词

引用

@article{arxiv.2212.08044,
  title  = {Benchmarking Robustness of Multimodal Image-Text Models under Distribution Shift},
  author = {Jielin Qiu and Yi Zhu and Xingjian Shi and Florian Wenzel and Zhiqiang Tang and Ding Zhao and Bo Li and Mu Li},
  journal= {arXiv preprint arXiv:2212.08044},
  year   = {2024}
}

备注

Accepted by Journal of Data-centric Machine Learning Research (DMLR) 2024