ITSELF:面向视觉语言检索的注意力引导细粒度对齐
计算机视觉与模式识别
2026-01-06 v1 人工智能
信息检索
摘要
视觉语言模型(Vision Language Models, VLMs)快速发展并展现出强大的潜力,用于基于文本的人员搜索(text-based person search, TBPS),该任务需要捕捉图像和文本之间细粒度的关系以区分个体。以往方法通过局部对齐来解决这些挑战,但容易产生捷足之 yd,导致误对齐。此外,注入先验知识会扰乱模块内结构。基于我们发现编码器注意力在最初训练历元中表现出空间精确证据的发现,为缓解这些问题,我们引入ITSELF,一个基于注意力的框架,用于隐式局部对齐。其核心,Guided Representation with Attentive Bank(GRAB)将模型自身的注意力转换为高显著性标记的注意力库,并在该库上应用局部目标,从而无需额外监督学习细粒度对应关系。为确保选择可靠且不重复,我们引入Multi-Layer Attention for Robust Selection(MARS),跨层聚合注意力并执行多样性感知的top-k选择;以及Adaptive Token Scheduler(ATS),在训练期间从粗到细调度保留预算,早期保持上下文,逐步聚焦于判别性细节。对三个广泛使用的TBPS基准进行大量实验表明,我们在保持无需额外先验监督的同时实现了领先的性能和强大的跨数据集泛化,确认了我们方法的有效性和鲁棒性。我们的项目已公开于https://trhuuloc.github.io/itself
引用
@article{arxiv.2601.01024,
title = {ITSELF: Attention Guided Fine-Grained Alignment for Vision-Language Retrieval},
author = {Tien-Huy Nguyen and Huu-Loc Tran and Thanh Duc Ngo},
journal= {arXiv preprint arXiv:2601.01024},
year = {2026}
}
备注
Accepted at WACV Main Track 2026