基于跨模态对齐的多提示学习在属性行人重识别中的应用
计算机视觉与模式识别
2023-12-29 v1
摘要
细粒度属性描述能够为人物图像补充重要的语义信息,这对于行人重识别任务的成功至关重要。然而,当前的 ReID 算法通常未能有效利用可用的丰富上下文信息,主要因为它们对图像属性的利用过于简单和粗略。人工智能生成内容的最新进展使得自动生成大量细粒度属性描述并加以充分利用成为可能。因此,本文探索了在 ReID 任务中利用现成(大)模型将生成的多个人物属性作为提示,以获得更准确检索结果的潜力。为此,我们提出了一种名为 Multi-Prompts ReID (MP-ReID) 的新框架,基于提示学习和语言模型,充分挖掘细粒度属性以辅助 ReID 任务。具体而言,MP-ReID 首先学习为查询图像生成多样化的、信息丰富的且可提示的描述句子。该过程包括:该人物具有哪些属性的显式提示,以及进一步用于调整/约束该人物身份匹配标准的隐式可学习提示。显式提示通过集成生成模型(如 ChatGPT 和 VQA 模型)获得。此外,设计了一个对齐模块来渐进式融合多提示(即显式和隐式提示),并缓解跨模态差异。在现有的涉及属性的 ReID 数据集(即 Market1501 和 DukeMTMC-reID)上的大量实验,证明了所提出的 MP-ReID 方案的有效性与合理性。
引用
@article{arxiv.2312.16797,
title = {Multi-Prompts Learning with Cross-Modal Alignment for Attribute-based Person Re-Identification},
author = {Yajing Zhai and Yawen Zeng and Zhiyong Huang and Zheng Qin and Xin Jin and Da Cao},
journal= {arXiv preprint arXiv:2312.16797},
year = {2023}
}
备注
AAAI 2024