中文

CLEAR:用于人员属性识别与检索的预训练语言模型交叉 Transformer 足矣

计算机视觉与模式识别 2024-05-01 v2

摘要

人员属性识别和基于属性的检索是两项核心的以人为本的任务。在识别任务中,挑战在于根据人的外观指定属性,而检索任务则涉及基于属性查询搜索匹配的人员。识别任务与检索任务之间存在显著关联。在本研究中,我们证明如果存在一个足够强大的网络来解决人员属性识别问题,它可以被适配以促进检索任务获得更好的性能。检索任务中需要解决的另一个问题是属性查询与人员图像之间的模态差距。因此,在本文中,我们提出了 CLEAR,一个旨在解决这两项任务的统一网络。我们引入了一种强大的交叉 Transformer 网络来处理人员属性识别。此外,利用预训练语言模型,我们为属性查询构建伪描述,并引入一种有效的训练策略,仅训练适配器 (adapters) 的少量额外参数,从而促进检索任务的处理。最后,统一的 CLEAR 模型在五个基准数据集上进行了评估:PETA、PA100K、Market-1501、RAPv2 和 UPAR-2024。无需特殊技巧,CLEAR 在这两项任务中均实现了最先进 (SOTA) 的性能或具有竞争力的结果,且在广泛使用的 Market-1501 数据集上的人员检索性能方面显著优于其他竞争者。

关键词

引用

@article{arxiv.2403.06119,
  title  = {CLEAR: Cross-Transformers with Pre-trained Language Model is All you need for Person Attribute Recognition and Retrieval},
  author = {Doanh C. Bui and Thinh V. Le and Ba Hung Ngo and Tae Jong Choi},
  journal= {arXiv preprint arXiv:2403.06119},
  year   = {2024}
}