中文

FAST-GOAL:面向长文本的快速且高效的全局-局部对象对齐学习

人工智能 2026-05-27 v1

摘要

视觉语言模型如 CLIP 在对齐图像和文本方面展现出惊人的能力,但由于在短小精炼的描述上进行预训练,往往难以处理冗长且详尽的文本描述。我们提出了 FAST-GOAL(Fast and Efficient Global-local Object Alignment Learning),一种高效的微调方法,通过全局-局部语义对齐来增强 CLIP 处理长文本的能力。该方法包含两个关键组件:首先,Fast Local Image-Sentence Matching (FLISM) 通过目标检测和空间划分高效提取局部图像区域,然后将其与相应的句子进行匹配。其次,基于相似性的学习 (Token Similarity-based Learning, TSL) 通过最大化来自特定图像区域的 patch tokens 与其对应区域嵌入之间的相似性,同时对文本应用相同的原则,从而增强模型捕获详细对应关系的能力。此外,我们引入了 GLIT100k 数据集,提供全局图像-长caption 对以及源自上下文的局部对,其中局部描述从全局caption 中提取,以保持语义连贯性。在针对长caption 数据集(DOCCI、DCI)和短caption 数据集(MSCOCO、Flickr30k)进行大量实验后,我们证明 FAST-GOAL 在基线上实现了显著的改进,使 CLIP 能够有效适应详细的文本描述,同时保持计算效率。

关键词

引用

@article{arxiv.2605.26615,
  title  = {FAST-GOAL: Fast and Efficient Global-local Object Alignment Learning},
  author = {Hyungyu Choi and Young Kyun Jang and Chanho Eom},
  journal= {arXiv preprint arXiv:2605.26615},
  year   = {2026}
}

备注

21 pages, 8 figures, IEEE/TIP 2026 accepted