中文

论多模态学习的鲁棒性

机器学习 2023-04-12 v2

摘要

多模态学习被定义为在视频、音频和文本等多种异构输入模态上进行学习。在本工作中,我们关注模型在训练与部署阶段所用模态类型不一致时的行为,这种情况在自然发生于多模态学习面向硬件平台的诸多应用中。我们提出一个多模态鲁棒性框架,以对常见的多模态表示学习方法进行系统分析。此外,我们指出了这些方法的鲁棒性不足,并提出了两种干预技术,在 AudioSet、Kinetics-400 和 ImageNet-Captions 三个数据集上实现了 1.5×1.5\times-4×4\times 的鲁棒性提升。最后,我们证明这些干预能更好地利用额外的模态(若存在)以在 AudioSet 20K 上取得 44.244.2 mAP 的竞争性结果。

关键词

引用

@article{arxiv.2304.04385,
  title  = {On Robustness in Multimodal Learning},
  author = {Brandon McKinzie and Joseph Cheng and Vaishaal Shankar and Yinfei Yang and Jonathon Shlens and Alexander Toshev},
  journal= {arXiv preprint arXiv:2304.04385},
  year   = {2023}
}