中文

STMI:用于多模态目标重识别的分段引导标记调制与跨模态超图交互

计算机视觉与模式识别 2026-03-03 v1

摘要

多模态目标重识别(ReID)旨在利用不同模态的互补信息来检索特定对象。然而,现有方法常依赖硬token过滤或简单融合策略,导致判别线索丢失和背景干扰增加。为解决这些挑战,我们提出了STMI,一种新型的多模态学习框架,包含三个关键组件:(1)分段引导特征调制(SFM)模块利用SAM生成的掩码,通过可学习注意力调制增强前景表示并抑制背景噪声;(2)语义token重新分配(STR)模块采用可学习查询token和自适应重新分配机制,从不丢弃任何token的前提下提取紧凑且信息丰富的表示;(3)跨模态超图交互(CHI)模块构建跨模态的统一超图,以捕获高阶语义关系。在公共基准测试(即 RGBNT201、RGBNT100 和 MSVR310)上的大量实验表明,我们提出的STMI框架在多模态ReID场景中具有有效性和鲁棒性。

关键词

引用

@article{arxiv.2603.00695,
  title  = {STMI: Segmentation-Guided Token Modulation with Cross-Modal Hypergraph Interaction for Multi-Modal Object Re-Identification},
  author = {Xingguo Xu and Zhanyu Liu and Weixiang Zhou and Yuansheng Gao and Junjie Cao and Yuhao Wang and Jixiang Luo and Dell Zhang},
  journal= {arXiv preprint arXiv:2603.00695},
  year   = {2026}
}

备注

Accepted to AAAI 2026