FineLIP:通过更长文本输入的细粒度对齐扩展 CLIP 的能力
计算机视觉与模式识别
2025-04-03 v1 人工智能
计算与语言
摘要
作为开创性的视觉-语言模型,CLIP(对比语言-图像预训练)在各个领域和广泛的视觉-语言下游任务中取得了显著成功。然而,流行 CLIP 模型中的文本编码器仅限于处理 77 个文本标记,这限制了其有效处理更长、更丰富的细节描述的能力。此外,CLIP 模型往往难以有效捕捉详细的视觉和文本信息,从而影响其需要细粒度分析的任务的性能。为了解决这些限制,我们提出了一种新方法 \textbf{FineLIP},通过在 CL\textbf{IP}-style 框架中结合 \textbf{Fine}-粒度对齐与 \textbf{L}onger 文本输入来扩展 CLIP 的能力。FineLIP 首先扩展位置编码以处理更长文本,然后对局部图像和文本标记进行动态聚合。聚合结果随后用于强制细粒度的标记到标记跨模态对齐。我们在具有长而详细描述的数据集上的两个任务上验证了模型:零样本跨模态检索和文本到图像生成。定量和定性实验结果证明了 FineLIP 的有效性,优于现有的最先进方法。此外,全面的消融实验验证了 FineLIP 中关键设计元素的优势。
引用
@article{arxiv.2504.01916,
title = {FineLIP: Extending CLIP's Reach via Fine-Grained Alignment with Longer Text Inputs},
author = {Mothilal Asokan and Kebin Wu and Fatima Albreiki},
journal= {arXiv preprint arXiv:2504.01916},
year = {2025}
}