UniCat:为多模态重识别打造更强的融合基线
计算机视觉与模式识别
2023-10-31 v1
摘要
多模态重识别 (ReID) 是一项流行的检索任务,旨在跨不同数据流重新识别对象,促使许多研究者将多种模态整合为统一表征。尽管此类融合有望提供整体视角,我们的研究揭示了潜在缺陷。我们发现,与孤立训练模态的方法相比,主流的后期融合技术常产生次优的潜在表征。我们认为该效应主要源于融合时对各单独模态训练目标的无意放宽,即他人所称的模态惰性。我们提出一种细致观点:这种放宽会导致某些模态未能充分利用可用的任务相关信息,然而却为噪声模态提供保护罩,防止其过拟合到任务无关数据。我们的发现还表明,单模态拼接 (UniCat) 及其它单模态骨干的后期融合集成,在搭配已知最佳训练技术时,在多个多模态 ReID 基准上超越当前最优性能。通过揭示“模态惰性”的双刃剑效应,我们激励未来研究在局部模态优势与全局表征间取得平衡。
引用
@article{arxiv.2310.18812,
title = {UniCat: Crafting a Stronger Fusion Baseline for Multimodal Re-Identification},
author = {Jennifer Crawford and Haoli Yin and Luke McDermott and Daniel Cummings},
journal= {arXiv preprint arXiv:2310.18812},
year = {2023}
}
备注
Accepted NeurIPS 2023 UniReps, 9 pages, 4 tables