SyCoCa:用于多模态对齐的基于注意力掩码的对称对比描述器
计算机视觉与模式识别
2024-01-05 v1 人工智能
摘要
语言与视觉之间的多模态对齐是当前视觉-语言模型研究的基础课题。对比描述器作为代表性方法,将对比语言-图像预训练(CLIP)和图像描述(IC)集成到统一框架中,取得了令人瞩目的结果。CLIP 对整张图像和句子的全局表示施加双向约束。尽管 IC 在局部表示上进行单向的图像到文本生成,但它缺乏对局部文本到图像重建的任何约束,这限制了其在与文本对齐时对图像进行细粒度理解的能力。为了从全局和局部视角实现多模态对齐,本文提出了对称对比描述器,在全局和局部表示层面引入图像与文本之间的双向交互。具体而言,我们在 ITC 和 IC 头的基础上扩展了一个文本引导的掩码图像建模(TG-MIM)头。改进后的 SyCoCa 可以进一步利用文本线索重建上下文图像,并利用视觉线索预测文本内容。在实现双向局部交互时,图像的局部内容往往显得杂乱或与其文本描述无关。因此,我们采用注意力掩码策略来选择有效的图像块进行交互。在五个视觉-语言任务(包括图文检索、图像描述、视觉问答和零样本/微调图像分类)上的大量实验验证了我们提出方法的有效性。
引用
@article{arxiv.2401.02137,
title = {SyCoCa: Symmetrizing Contrastive Captioners with Attentive Masking for Multimodal Alignment},
author = {Ziping Ma and Furong Xu and Jian Liu and Ming Yang and Qingpei Guo},
journal= {arXiv preprint arXiv:2401.02137},
year = {2024}
}