中文

GraFT:面向多模态重识别的渐进融合 Transformer

计算机视觉与模式识别 2023-10-27 v1

摘要

目标重识别(ReID)在计算机视觉中至关重要,对熟练多模态表示学习的需求不断攀升。当前模型虽有前景,却因严重依赖后期融合(推迟了特定模态信息的整合)而在模态增多时显现出可扩展性局限。为此,我们引入了面向多模态 ReID 的\textbf{渐进融合 Transformer(GraFT)}。GraFT 的核心在于采用可学习的融合令牌引导各编码器间的自注意力,巧妙捕捉模态特定与对象特定特征。为进一步增强效能,我们提出了一种结合增广三元组损失的新型训练范式,以优化 ReID 特征嵌入空间。我们通过大量消融实验证明了这些改进,并表明 GraFT 持续超越既定的多模态 ReID 基准。此外,为兼顾部署灵活性,我们将神经网络剪枝集成入 GraFT,在模型规模与性能间提供平衡。

关键词

引用

@article{arxiv.2310.16856,
  title  = {GraFT: Gradual Fusion Transformer for Multimodal Re-Identification},
  author = {Haoli Yin and Jiayao Li and Eva Schiller and Luke McDermott and Daniel Cummings},
  journal= {arXiv preprint arXiv:2310.16856},
  year   = {2023}
}

备注

3 Borderline Reviews at WACV, 8 pages, 5 figures, 8 tables