HiCLIP:具有层次感知注意力的对比语言-图像预训练
计算机视觉与模式识别
2023-03-07 v1 计算与语言
机器学习
摘要
大规模对比视觉-语言预训练(CLIP)的成功惠及了视觉识别与多模态内容理解。其简洁的设计使 CLIP 相较于其他带有更重交叉注意力融合层的视觉-语言模型在推理效率上具有优势,使其成为广泛下游任务的热门选择。然而,CLIP 并未显式捕捉图像与文本所传达的高层与细粒度语义的层次性,而这 arguably 对视觉-语言理解与推理至关重要。为此,我们为 CLIP 的视觉与语言分支均配备层次感知注意力,即层次感知 CLIP(HiCLIP),以无监督方式逐层从图像与文本中渐进发现语义层次。结果,这种层次聚合显著改善了跨模态对齐。为展示 HiCLIP 的优势,我们对其推理时的无监督层次归纳做了定性分析,并在视觉识别与视觉-语言下游任务上进行了广泛的定量实验。
引用
@article{arxiv.2303.02995,
title = {HiCLIP: Contrastive Language-Image Pretraining with Hierarchy-aware Attention},
author = {Shijie Geng and Jianbo Yuan and Yu Tian and Yuxiao Chen and Yongfeng Zhang},
journal= {arXiv preprint arXiv:2303.02995},
year = {2023}
}
备注
Accepted at ICLR 2023