面向组合行人检索的自动合成数据与细粒度自适应特征对齐
计算机视觉与模式识别
2025-05-21 v4 人工智能
信息检索
摘要
行人检索已引起日益增长的关注。现有方法主要分为两种检索模式,即仅图像与仅文本。然而,它们无法充分利用可用信息且难以满足多样化应用需求。为解决上述局限,我们提出一项新的组合行人检索(CPR)任务,其结合视觉与文本查询从大规模行人图像数据库中识别感兴趣个体。然而,CPR任务的首要困难是缺乏可用标注数据集。因此,我们首先引入可扩展的自动数据合成流水线,将复杂多模态数据生成分解为文本四元组创建,随后使用微调生成模型进行身份一致图像合成。同时,设计多模态过滤方法以确保生成的SynCPR数据集保留115万高质量全合成三元组。此外,为改进组合行人查询的表征,我们通过细粒度动态对齐与掩码特征推理提出一种新颖的细粒度自适应特征对齐(FAFA)框架。而且,为客观评估,我们手动标注了图像-文本组合行人检索(ITCPR)测试集。大量实验证明了SynCPR数据集的有效性以及所提FAFA框架相较最先进方法的优越性。所有代码与数据将提供于 https://github.com/Delong-liu-bupt/Composed_Person_Retrieval。
引用
@article{arxiv.2311.16515,
title = {Automatic Synthetic Data and Fine-grained Adaptive Feature Alignment for Composed Person Retrieval},
author = {Delong Liu and Haiwen Li and Zhaohui Hou and Zhicheng Zhao and Fei Su and Yuan Dong},
journal= {arXiv preprint arXiv:2311.16515},
year = {2025}
}