跨模态UNet: 学习模态无关表征
计算机视觉与模式识别
2026-05-19 v1 机器学习
摘要
跨模态识别在科学、执法和娱乐等领域具有重要应用。将模态差异降低为表征差异、学习不可区分的表征或显式模态转换等流行方法。前两种方法在去除模态特定变异的同时会丢失判别信息。第三种方法高度依赖成功的模态转换,当显式模态转换不可行或困难时,可能导致灾难性性能下降。为解决此问题,我们提出了一个紧凑的编码器-解码器神经模块(cmUNet),用于在保留身份相关信息的同时学习模态无关表征。通过跨模态转换和同模态重建实现此目标,由对抗/感知损失增强,鼓励对原始样本空间中表征的不可区分性。在跨模态匹配方面,我们提出了MarrNet,其中将cmUNet连接到标准特征提取网络,该网络以模态无关表征为输入,输出匹配的相似度得分。我们在五个具有挑战性的任务上对方法进行了验证,包括拉曼-红外光谱匹配、跨模态人体再识别和异构(照片-草图、可见-近红外和可见-热成像)人脸识别,其中MarrNet在与当前方法相比时表现出优异的性能。此外,观察到跨模态匹配方法可能因处理不善而偏向从部分甚至错误区域提取判别信息,从而导致泛化能力差。我们表明,对遮挡的鲁棒性可以作为衡量方法是否良好桥接模态差异的指标。
引用
@article{arxiv.2605.16887,
title = {Mind the Gap: Learning Modality-Agnostic Representations with a Cross-Modality UNet},
author = {Xin Niu and Enyi Li and Jinchao Liu and Yan Wang and Margarita Osadchy and Yongchun Fang},
journal= {arXiv preprint arXiv:2605.16887},
year = {2026}
}
备注
Published in IEEE Transactions on Image Processing. See full abstract in the PDF file