ManagerTower:聚合单模态专家洞见用于视觉-语言表示学习
计算机视觉与模式识别
2023-06-02 v1 计算与语言
机器学习
摘要
双塔视觉-语言(VL)模型已在多种下游VL任务上展现出可喜的改进。尽管最先进的工作通过构建编码器间的桥梁提升了性能,但其存在单模态表示逐层利用低效、且无法灵活挖掘不同层级单模态语义知识的问题。本工作中,我们提出ManagerTower,一种新颖的VL模型架构,其在不同层级收集并组合预训练单模态专家的洞见。各跨模态层中引入的管理器可自适应聚合单模态语义知识,以促进更全面的跨模态对齐与融合。ManagerTower在有和无视觉-语言预训练(VLP)的情况下均优于此前的强基线。仅用4M VLP数据,ManagerTower在各下游VL任务上取得优越性能,尤其在VQAv2 Test-Std上达79.15%准确率,在Flickr30K上达86.56% IR@1与95.64% TR@1。代码与检查点见 https://github.com/LooperXX/ManagerTower。
引用
@article{arxiv.2306.00103,
title = {ManagerTower: Aggregating the Insights of Uni-Modal Experts for Vision-Language Representation Learning},
author = {Xiao Xu and Bei Li and Chenfei Wu and Shao-Yen Tseng and Anahita Bhiwandiwalla and Shachar Rosenman and Vasudev Lal and Wanxiang Che and Nan Duan},
journal= {arXiv preprint arXiv:2306.00103},
year = {2023}
}
备注
Accepted by ACL 2023 Main Conference, Oral