中文

BridgeTower:在视觉-语言表征学习的编码器间架桥

计算机视觉与模式识别 2024-03-28 v6 计算与语言 机器学习

摘要

具有双塔架构的视觉-语言(VL)模型近年来主导了视觉-语言表征学习。当前的VL模型要么使用轻量级单模态编码器,并在深层跨模态编码器中同时学习提取、对齐与融合两种模态,要么将深层预训练单模态编码器的最后一层单模态表示送入顶层跨模态编码器。这两种方式都可能限制视觉-语言表征学习并制约模型性能。本文中,我们提出BridgeTower,其引入多个桥接层,在单模态编码器的顶层与跨模态编码器的每一层之间建立连接。这使得跨模态编码器内预训练单模态编码器的不同语义层级的视觉与文本表示之间能够实现有效的自底向上跨模态对齐与融合。仅以4M图像预训练,BridgeTower在各种下游视觉-语言任务上取得了最先进的性能。特别是在VQAv2 test-std集上,BridgeTower取得了78.73%的准确率,在相同预训练数据下以几乎可忽略的额外参数与计算成本超越先前最先进模型METER达1.09%。值得注意的是,当进一步扩展模型时,BridgeTower取得了81.15%的准确率,超越了那些在数量级更大数据集上预训练的模型。代码与检查点发布于 https://github.com/microsoft/BridgeTower。

关键词

引用

@article{arxiv.2206.08657,
  title  = {BridgeTower: Building Bridges Between Encoders in Vision-Language Representation Learning},
  author = {Xiao Xu and Chenfei Wu and Shachar Rosenman and Vasudev Lal and Wanxiang Che and Nan Duan},
  journal= {arXiv preprint arXiv:2206.08657},
  year   = {2024}
}

备注

Accepted by AAAI 2023, Oral