UMG-CLIP:面向开放世界理解的统一多粒度视觉通才
计算机视觉与模式识别
2024-10-30 v3
摘要
以对比语言-图像预训练(CLIP)为代表的视觉-语言基础模型,因其联合理解视觉和文本任务的能力而受到越来越多的关注。然而,现有方法主要侧重于训练模型将全局图像表示与文本描述进行匹配,从而忽略了局部区域与相应文本标记之间的关键对齐。本文将CLIP扩展到多粒度对齐。值得注意的是,我们特意构建了一个新的数据集,包含不同粒度级别的伪标注,涵盖图像级、区域级以及像素级的标题和标签。据此,我们开发了一个统一的多粒度学习框架,称为UMG-CLIP,它同时赋予模型在不同细节层次上的通用感知能力。通过参数高效微调,UMG-CLIP超越了当前广泛使用的CLIP变体,并在多种图像理解基准上取得了最先进的性能,包括开放世界识别、检索、语义分割和全景分割任务。我们相信UMG-CLIP代表了视觉-语言基础模型的一个有价值的进步。代码可在https://github.com/lygsbw/UMG-CLIP获取。
引用
@article{arxiv.2401.06397,
title = {UMG-CLIP: A Unified Multi-Granularity Vision Generalist for Open-World Understanding},
author = {Bowen Shi and Peisen Zhao and Zichen Wang and Yuhang Zhang and Yaoming Wang and Jin Li and Wenrui Dai and Junni Zou and Hongkai Xiong and Qi Tian and Xiaopeng Zhang},
journal= {arXiv preprint arXiv:2401.06397},
year = {2024}
}
备注
ECCV 2024