中文

HiCLIP:具有层次感知注意力的对比语言-图像预训练

计算机视觉与模式识别 2023-03-07 v1 计算与语言 机器学习

摘要

大规模对比视觉-语言预训练(CLIP)的成功惠及了视觉识别与多模态内容理解。其简洁的设计使 CLIP 相较于其他带有更重交叉注意力融合层的视觉-语言模型在推理效率上具有优势,使其成为广泛下游任务的热门选择。然而,CLIP 并未显式捕捉图像与文本所传达的高层与细粒度语义的层次性,而这 arguably 对视觉-语言理解与推理至关重要。为此,我们为 CLIP 的视觉与语言分支均配备层次感知注意力,即层次感知 CLIP(HiCLIP),以无监督方式逐层从图像与文本中渐进发现语义层次。结果,这种层次聚合显著改善了跨模态对齐。为展示 HiCLIP 的优势,我们对其推理时的无监督层次归纳做了定性分析,并在视觉识别与视觉-语言下游任务上进行了广泛的定量实验。

关键词

引用

@article{arxiv.2303.02995,
  title  = {HiCLIP: Contrastive Language-Image Pretraining with Hierarchy-aware Attention},
  author = {Shijie Geng and Jianbo Yuan and Yu Tian and Yuxiao Chen and Yongfeng Zhang},
  journal= {arXiv preprint arXiv:2303.02995},
  year   = {2023}
}

备注

Accepted at ICLR 2023