TULIP:标记长度升级版 CLIP
计算机视觉与模式识别
2025-03-31 v2
摘要
我们解决了在视觉语言模型(如 CLIP)中表示长描述的挑战。由于这些模型受固定、绝对位置编码的限制,输入受限于最大 77 个标记,阻碍了在需要更长描述的任务上的性能。尽管最近的工作尝试突破这一限制,但其提出的方法在建模更长距离上的标记关系方面存在困难,且仅能简单地扩展到固定的新标记长度。相反,我们提出了一种通用方法,命名为 TULIP,能够将 CLIP 类模型的标记长度升级到任意长度。为此,我们通过相对位置编码改进了模型架构,随后采用训练程序:(i) 将原始 CLIP 文本编码器蒸馏到具有相对位置编码的编码器中;(ii) 为对齐更长的描述与图像增强模型。通过有效地编码超过默认 77 个标记的描述,我们的模型在检索和文本到图像生成等跨模态任务上超越了基准模型。代码仓库已公开 https://github.com/ivonajdenkoska/tulip。
引用
@article{arxiv.2410.10034,
title = {TULIP: Token-length Upgraded CLIP},
author = {Ivona Najdenkoska and Mohammad Mahdi Derakhshani and Yuki M. Asano and Nanne van Noord and Marcel Worring and Cees G. M. Snoek},
journal= {arXiv preprint arXiv:2410.10034},
year = {2025}
}