中文

Signal: 选择性交互与全局-局部对齐的多模态物体重识别框架

计算机视觉与模式识别 2025-11-25 v1 多媒体

摘要

多模态物体重识别 (ReID) 旨在通过挖掘互补的多模态图像信息来检索特定物体。现有方法主要关注多模态特征的融合,却忽略了背景干扰。此外,当前的多模态融合方法常侧重于两两模态间的对齐,但存在多模态一致性对齐不足的问题。为此,本文提出一种新颖的选择性交互与全局-局部对齐框架,命名为 Signal,用于多模态物体 ReID。具体而言,本文首先提出选择性交互模块 (SIM),通过选择具有 intra-modal 和 inter-modal 信息的重要 patch token。这些重要 patch token 与 class token 进行交互,从而获得更具辨识度的特征。随后,本文提出全局对齐模块 (GAM),通过最小化 gramian 空间中 3D 多面体的体积来实现多模态特征的同步对齐。同时,本文提出局部对齐模块 (LAM),以平移感知的方式对局部特征进行对齐。通过上述模块,该框架能够为物体 ReID 提取更具辨识度的特征。在三个多模态物体 ReID 数据集 (即 RGBNT201、RGBNT100、MSVR310) 上的大量实验验证了本方法的有效性。源码已公开于 https://github.com/010129/Signal。

关键词

引用

@article{arxiv.2511.17965,
  title  = {Signal: Selective Interaction and Global-local Alignment for Multi-Modal Object Re-Identification},
  author = {Yangyang Liu and Yuhao Wang and Pingping Zhang},
  journal= {arXiv preprint arXiv:2511.17965},
  year   = {2025}
}

备注

Accepted by AAAI2026. More modifications may be performed