Alpha-CLIP:聚焦于任意位置的 CLIP 模型
计算机视觉与模式识别
2023-12-15 v2 人工智能
计算与语言
机器学习
摘要
对比语言-图像预训练(CLIP)在各种任务中从图像中提取有价值的内容信息方面发挥着重要作用。它对齐文本和视觉模态以理解整个图像,包括所有细节,甚至那些与特定任务无关的细节。然而,为了对图像进行更精细的理解和受控编辑,关注特定的感兴趣区域变得至关重要,这些区域可由人类或感知模型表示为点、掩码或框。为了满足这些要求,我们引入了 Alpha-CLIP,这是 CLIP 的增强版本,带有用于指示关注区域的辅助 alpha 通道,并使用构建的数百万个 RGBA 区域-文本对进行了微调。Alpha-CLIP 不仅保留了 CLIP 的视觉识别能力,还实现了对图像内容强调程度的精确控制。它在各种任务中均展现出有效性,包括但不限于开放世界识别、多模态大型语言模型以及条件 2D / 3D 生成。它具有作为图像相关任务多功能工具的强大潜力。
引用
@article{arxiv.2312.03818,
title = {Alpha-CLIP: A CLIP Model Focusing on Wherever You Want},
author = {Zeyi Sun and Ye Fang and Tong Wu and Pan Zhang and Yuhang Zang and Shu Kong and Yuanjun Xiong and Dahua Lin and Jiaqi Wang},
journal= {arXiv preprint arXiv:2312.03818},
year = {2023}
}
备注
project page: https://aleafy.github.io/alpha-clip code: https://github.com/SunzeY/AlphaCLIP