视频-语言模型对视觉与语言扰动的鲁棒性分析
计算机视觉与模式识别
2023-07-19 v4 多媒体
摘要
与单模态学习相比,在大规模数据集上的联合视觉与语言建模近期在多模态任务中取得了良好进展。然而,这些方法针对真实世界扰动的鲁棒性尚未得到研究。在本工作中,我们首次对视频-语言模型在各种真实世界扰动下的鲁棒性进行了广泛的实证研究。我们聚焦于文本到视频检索,并提出了两个大规模基准数据集MSRVTT-P与YouCook2-P,其利用了90种不同的视觉扰动与35种不同的文本扰动。该研究从所考察的模型中揭示了一些有趣的初步发现:1)仅扰动视频时模型通常比仅扰动文本时更脆弱;2)经过预训练的模型比从头训练的模型更鲁棒;3)模型更关注场景与物体而非运动与动作。我们希望本研究可作为基准并指导未来鲁棒视频-语言学习的研究。本研究所引入的基准及代码与数据集可在 https://bit.ly/3CNOly4 获取。
引用
@article{arxiv.2207.02159,
title = {Robustness Analysis of Video-Language Models Against Visual and Language Perturbations},
author = {Madeline C. Schiappa and Shruti Vyas and Hamid Palangi and Yogesh S. Rawat and Vibhav Vineet},
journal= {arXiv preprint arXiv:2207.02159},
year = {2023}
}
备注
NeurIPS 2022 Datasets and Benchmarks Track. This projects webpage is located at https://bit.ly/3CNOly4