VoLTA:基于弱监督局部特征对齐的视觉-语言 Transformer
计算机视觉与模式识别
2023-10-31 v3 机器学习
多媒体
摘要
视觉-语言预训练(VLP)近来已证明对各类单模态和多模态下游应用极为有效。然而,大多数现有的端到端 VLP 方法需要使用高分辨率图像-文本框数据,才能在细粒度区域级任务(如目标检测、分割和指代表达理解)上表现良好。遗憾的是,此类带有精确边界框标注的高分辨率图像收集成本高昂,且难以大规模用于监督。在本工作中,我们提出 VoLTA(基于弱监督局部特征对齐的视觉-语言 Transformer),一种仅利用图像-描述数据但可实现细粒度区域级图像理解的新 VLP 范式,从而免除了对昂贵框标注的使用。VoLTA 在局部图像块与文本词元上采用基于图最优传输的弱监督对齐,以萌生一种显式的、自归一化的且可解释的低层匹配准则。此外,VoLTA 在预训练期间将多模态融合深入推入单模态骨干网络,并移除融合专用的 Transformer 层,进一步降低了内存需求。在广泛视觉与视觉-语言下游任务上的大量实验表明,VoLTA 在细粒度应用上的有效性不以牺牲粗粒度下游性能为代价,且常优于使用显著更多描述与框标注的方法。
引用
@article{arxiv.2210.04135,
title = {VoLTA: Vision-Language Transformer with Weakly-Supervised Local-Feature Alignment},
author = {Shraman Pramanick and Li Jing and Sayan Nag and Jiachen Zhu and Hardik Shah and Yann LeCun and Rama Chellappa},
journal= {arXiv preprint arXiv:2210.04135},
year = {2023}
}
备注
Published in TMLR 2023