图像中森林与树的对齐 & 长标题下的视觉依据理解
计算机视觉与模式识别
2026-05-14 v2 人工智能
机器学习
摘要
视觉语言模型如CLIP在理解长篇 detail-rich 描述时常常难以忠实地理解,倾向于依赖主导场景线索而忽视细粒度视觉证据。我们提出了一种分层视觉语言学习原则,用于理解作为部件到整体构成的场景:在形成整体场景表示之前,模型应发现语义部件在图像中出现的具体位置。为此,我们提出了CAFT(Cross-domain Alignment of Forests and Trees),一种视觉语言模型,同时学习中间表示下的局部文本-区域对齐和最终表示下的全局图像-文本对齐。利用长标题的组织结构,其中局部描述常对应场景部件,CAFT采用细到粗的图像编码器和部件-整体文本编码器,以发现局部部件语义并逐步构成全局图像-文本表示。基于3000万图像-文本对进行训练,CAFT在六个长文本检索基准测试中实现了最先进的性能,并表现出良好的扩展行为。实验表明,CAFT学习的细粒度表示能够在无需显式区域级监督的情况下,将文本语义局部化到图像区域。
引用
@article{arxiv.2602.02977,
title = {Aligning Forest and Trees in Images & Long Captions for Visually Grounded Understanding},
author = {Byeongju Woo and Zilin Wang and Byeonghyun Pak and Sangwoo Mo and Stella X. Yu},
journal= {arXiv preprint arXiv:2602.02977},
year = {2026}
}
备注
Preprint