中文

通过幻觉学习:基于弱监督的视觉-语言预训练

计算机视觉与模式识别 2022-10-28 v2

摘要

弱监督视觉-语言(V-L)预训练(W-VLP)旨在利用极少或无需配对数据(如对齐的图像与描述文本)来学习跨模态对齐。近期将视觉特征与物体标签配对的 W-VLP 方法,在各种 V-L 下游任务中达到了与某些使用对齐对训练的 VLP 模型相当的性能。然而,在跨模态检索(XMR)中并非如此。我们认为此类 W-VLP 模型的学习受到语义有限的物体标签的制约与偏置。我们通过一种新颖的基于视觉词汇的特征幻觉器(WFH)来解决模型监督缺乏配对 V-L 数据的问题,该幻觉器作为 W-VLP 模型通过弱监督训练,无需与描述文本配对的图像。WFH 从文本生成视觉幻觉,再将其与原本未配对的文本配对,从而实现跨模态间更多样的交互。实证上,WFH 持续提升了先前的 W-VLP 工作,例如 U-VisualBERT(U-VB),在多种 V-L 任务(即 XMR、视觉问答等)上。值得注意的是,以 recall@{1,5,10} 为基准,它在 Flickr30K 和 MSCOCO 两个流行数据集上持续提升了 U-VB 的图像到文本与文本到图像检索。同时,在这些 XMR 任务的交叉数据集泛化测试中,它至少提升了 14.5%。此外,在所考虑的其他 V-L 下游任务中,我们的 WFH 模型与用配对 V-L 数据训练的模型表现相当,揭示了未配对数据的效用。这些结果展示了所提带 WFH 的 W-VLP 模型更强的泛化能力。

关键词

引用

@article{arxiv.2210.13591,
  title  = {Learning by Hallucinating: Vision-Language Pre-training with Weak Supervision},
  author = {Tzu-Jui Julius Wang and Jorma Laaksonen and Tomas Langer and Heikki Arponen and Tom E. Bishop},
  journal= {arXiv preprint arXiv:2210.13591},
  year   = {2022}
}

备注

Accepted to WACV'23. Please find supplementary material at https://drive.google.com/file/d/1SmCBGsUgkYLAhmK83RZqY03bq4j3214p/view?usp=sharing