用于评估视觉与语言学习鲁棒性的跨模态属性插入
计算与语言
2023-06-21 v1 人工智能
计算机视觉与模式识别
摘要
多模态深度学习模型对输入文本中真实变化的鲁棒性,对于其在图文检索与跨模态蕴含等重要任务中的适用性至关重要。为衡量鲁棒性,若干现有方法对文本数据进行编辑,但并未利用多模态数据中存在的跨模态信息。来自视觉模态的信息,如颜色、大小和形状,提供了用户可在输入中包含的额外属性。因此,我们提出跨模态属性插入作为一种针对视觉与语言数据的真实扰动策略,该策略将图像中物体的视觉属性插入到相应文本中(例如,将“椅子上的女孩”变为“木椅上的小女孩”)。我们提出的跨模态属性插入方法是模块化、可控且与任务无关的。我们发现,使用跨模态插入增强输入文本会导致最先进的图文检索与跨模态蕴含方法表现不佳,分别造成 MRR 相对下降 15% 和 分数相对下降 20%。众包标注表明,跨模态插入比仅使用文本数据的增强能带来更高质量的多模态数据增强,且质量与原例相当。我们发布代码以鼓励对深度视觉与语言模型的鲁棒性评估:https://github.com/claws-lab/multimodal-robustness-xmai。
引用
@article{arxiv.2306.11065,
title = {Cross-Modal Attribute Insertions for Assessing the Robustness of Vision-and-Language Learning},
author = {Shivaen Ramshetty and Gaurav Verma and Srijan Kumar},
journal= {arXiv preprint arXiv:2306.11065},
year = {2023}
}
备注
Accepted full paper at ACL 2023; 15 pages, 7 figures