面向文本到图像行人检索的文本引导图像复原与语义增强
计算与语言
2025-01-20 v4 人工智能
计算机视觉与模式识别
摘要
文本到图像行人检索(TIPR)的目标是根据给定文本描述检索特定行人图像。该任务的一个主要挑战是弥合视觉与文本模态间巨大的表征鸿沟。主流方法将文本与图像映射至统一嵌入空间进行匹配,但文本与图像间复杂的语义对应仍未被有效构建。为解决此问题,我们提出一种新颖的 TIPR 框架,以构建行人图像与对应文本间的细粒度交互与对齐。具体而言,通过微调对比语言-图像预训练(CLIP)模型,首先构建视觉-文本双编码器,以初步对齐图像与文本特征。其次,提出文本引导图像复原(TIR)辅助任务,将抽象文本实体映射到特定图像区域,改善局部文本与视觉嵌入间的对齐。此外,提出跨模态三元组损失以处理困难样本,并进一步增强模型对微小差异的判别力。再者,提出基于剪枝的文本数据增强方法,以增强对描述中关键元素的关注,从而避免模型对次要信息过度关注。实验结果表明,我们所提方法在三个流行基准数据集上优于当前最优方法,代码将公开于 https://github.com/Delong-liu-bupt/SEN。
引用
@article{arxiv.2307.09059,
title = {Text-guided Image Restoration and Semantic Enhancement for Text-to-Image Person Retrieval},
author = {Delong Liu and Haiwen Li and Zhicheng Zhao and Yuan Dong},
journal= {arXiv preprint arXiv:2307.09059},
year = {2025}
}
备注
The paper was withdrawn due to a dispute among the authors regarding the content of the article