AXM-Net:面向行人重识别的隐式跨模态特征对齐网络
计算机视觉与模式识别
2022-07-22 v3 机器学习
摘要
跨模态行人重识别(Re-ID)对现代视频监控系统至关重要。关键挑战在于对齐由行人语义信息引发的跨模态表征,并忽略背景信息。本工作提出了一种基于卷积神经网络(CNN)的新颖架构,旨在学习语义对齐的跨模态视觉与文本表征。其基础构建模块称为 AXM-Block,是一个统一的多层网络,可动态利用来自两种模态的多尺度知识,并根据共享语义对每种模态进行重校准。为补充卷积设计,文本分支中应用了上下文注意力以处理长期依赖关系。此外,我们提出了一种独特设计以增强基于视觉部件的特征一致性与局部信息。我们的框架在新颖性上体现在能够在特征学习阶段隐式学习模态间的对齐语义。统一的特征学习有效地将文本数据作为视觉表征学习的超标注信号,并自动剔除无关信息。整个 AXM-Net 在 CUHK-PEDES 数据上端到端训练。我们报告了两项任务的结果:行人搜索与跨模态 Re-ID。AXM-Net 优于当前最先进(SOTA)方法,在 CUHK-PEDES 测试集上取得 64.44% 的 Rank@1;在 CrossRe-ID 与 CUHK-SYSU 数据集的跨视角文本到图像 Re-ID 场景中,也以 >10% 的优势超越竞争对手。
引用
@article{arxiv.2101.08238,
title = {AXM-Net: Implicit Cross-Modal Feature Alignment for Person Re-identification},
author = {Ammarah Farooq and Muhammad Awais and Josef Kittler and Syed Safwan Khalid},
journal= {arXiv preprint arXiv:2101.08238},
year = {2022}
}
备注
AAAI-2022 (Oral Paper)