中文

多模态预训练中对视觉关系的弱监督学习

计算与语言 2023-10-20 v2 计算机视觉与模式识别

摘要

近期视觉与语言预训练方面的研究探索了利用目标检测数据中的监督信号来学习更优、更细粒度的多模态表示。本文更进一步,探讨如何从小规模视觉关系数据中获取监督信息。具体而言,我们提出两种预训练方法,在多模态设置中对视觉实体进行语境化。通过言语化场景图,我们将视觉关系三元组转化为结构化描述,并将其作为额外的图像描述。通过掩码关系预测,我们进一步鼓励将图像区域的实体与视觉掩码上下文相关联。当应用于在大量网络数据上预训练的强基线时,在粗粒度与细粒度任务上的零样本评估均显示了我们的方法在从弱监督关系数据学习多模态表示方面的有效性。

关键词

引用

@article{arxiv.2305.14281,
  title  = {Weakly-Supervised Learning of Visual Relations in Multimodal Pretraining},
  author = {Emanuele Bugliarello and Aida Nematzadeh and Lisa Anne Hendricks},
  journal= {arXiv preprint arXiv:2305.14281},
  year   = {2023}
}

备注

EMNLP 2023