野外多模态重识别的全能框架
计算机视觉与模式识别
2024-05-09 v1
摘要
在重识别 (ReID) 领域,近期的进展在单模态和跨模态检索任务上取得了显著成果。然而,开发能够有效处理各种异构多模态数据(包括 RGB、红外、草图和文本信息)的统一框架仍面临挑战。此外,大规模模型在 various vision tasks 中展现出有前景的性能,但在 ReID 领域的 foundation model 仍然空白。针对这些挑战,本文引入一种新的多模态学习范式,用于 ReID,称为 All-in-One (AIO),它利用冻结的预训练大模型作为编码器,实现无需额外微调即可进行有效的多模态检索。AIO 中的异构多模态数据被无缝分词到统一的特征空间中,使模态共享的冻结编码器能够全面地跨越所有模态提取身份一致的特征。此外,设计了一套精心构思的跨模态 head,以引导学习轨迹。AIO 是首个实现全能 ReID 的框架,涵盖四种常用模态。在跨模态和多模态 ReID 实验中,AIO 不仅巧妙地处理了各种模态数据,还在具有挑战性的情境中表现出色,展示了在零样态和 domain generalization 场景中的卓越性能。
引用
@article{arxiv.2405.04741,
title = {All in One Framework for Multimodal Re-identification in the Wild},
author = {He Li and Mang Ye and Ming Zhang and Bo Du},
journal= {arXiv preprint arXiv:2405.04741},
year = {2024}
}
备注
12 pages, 3 figure, CVPR 2024