中文

基于融合的多模态分类器对跨模态内容稀释的鲁棒性

机器学习 2022-11-07 v1 人工智能 多媒体

摘要

随着多模态学习在各类高风险社会任务中找到应用,研究其鲁棒性变得重要。已有工作聚焦于理解视觉-语言模型对基准任务上不可感知变化的鲁棒性。本工作中,我们研究多模态分类器对跨模态稀释——一种合理变化——的鲁棒性。我们开发一个模型,给定多模态(图像+文本)输入,生成额外的稀释文本,其(a)与图像及已有文本保持相关性与主题连贯性,且(b)当加入原始文本时,导致多模态输入被误分类。通过在危机人道主义与情感检测任务上的实验,我们发现任务特定的基于融合的多模态分类器的性能在分别存在我们模型生成的稀释时下降 23.3% 与 22.5%。与若干基线的基于度量的比较及人工评估表明,我们的稀释显示出更高的相关性与主题连贯性,同时更有效地展示了多模态分类器的脆弱性。我们的工作旨在凸显并鼓励对深度多模态模型在真实变化下鲁棒性的进一步研究,尤其在面向人类的社会应用中。代码与其他资源见 https://claws-lab.github.io/multimodal-robustness/。

关键词

引用

@article{arxiv.2211.02646,
  title  = {Robustness of Fusion-based Multimodal Classifiers to Cross-Modal Content Dilutions},
  author = {Gaurav Verma and Vishwa Vinay and Ryan A. Rossi and Srijan Kumar},
  journal= {arXiv preprint arXiv:2211.02646},
  year   = {2022}
}

备注

Accepted at the 2022 Conference on Empirical Methods in Natural Language Processing (EMNLP); Full Paper (Oral)