知道该聚焦何处:基于注意力引导的文本搜索人员对齐
计算机视觉与模式识别
2024-12-20 v1
摘要
在文本搜索人员搜索(Text-Based Person Search, TBPS)领域,主流方法旨在探索文本描述与视觉数据之间更高效的交互框架。然而,近期方法面临两个主要挑战。首先,广泛使用的基于随机的遮蔽语言建模(Masked Language Modeling, MLM)在训练过程中将文本中所有单词视为等价。大量语义空洞单词(如 'with', 'the' 等)被遮蔽,无法在跨模态MLM中有效贡献交互,阻碍了表征对齐。其次,TBPS数据集中的手动描述繁琐且不可避免地包含若干不准确之处。为解决这些问题,本文引入了注意力引导对齐(Attention-Guided Alignment, AGA)框架,包含两个创新组件:注意力引导遮蔽(Attention-Guided Mask, AGM)建模和文本丰富模块(Text Enrichment Module, TEM)。AGM通过聚合文本编码过程中获得的注意力权重,动态遮蔽语义有意义的单词,从而实现跨模态MLM能够从文本上下文和图像中捕获与被遮蔽单词相关的信息并实现表征对齐。同时,TEM通过用MLM的预测替换那些语义有意义的单词来缓解由重复和错误文本描述导致的低质量表征。它不仅丰富了文本描述,也防止了过拟合。跨越三个具有挑战性的基准进行大量实验,证明了AGA的有效性,分别在CUHK-PEDES、ICFG-PEDES和RSTPReid上实现了新的状态突破,排名第一准确率分别达到78.36%、67.31%和67.4%。
引用
@article{arxiv.2412.15106,
title = {Knowing Where to Focus: Attention-Guided Alignment for Text-based Person Search},
author = {Lei Tan and Weihao Li and Pingyang Dai and Jie Chen and Liujuan Cao and Rongrong Ji},
journal= {arXiv preprint arXiv:2412.15106},
year = {2024}
}