解耦公共与独有表示的多模态自监督学习方法
计算机视觉与模式识别
2024-07-22 v3
摘要
多传感器数据可用性的增加引发了对多模态自监督学习的广泛兴趣。然而,大多数现有方法仅学习跨模态的公共表示,而忽略了模态内训练和模态独有表示。我们提出解耦公共与独有表示(DeCUR),一种简单而有效的多模态自监督学习方法。通过多模态冗余减少区分模态间与模态内嵌入,DeCUR 能够整合不同模态间的互补信息。我们在三种常见多模态场景(雷达-光学、RGB-高程和 RGB-深度)中评估 DeCUR,并证明无论架构如何以及对于多模态和模态缺失设置,其均有持续改进。通过详尽的实验和全面分析,我们希望本工作能提供有价值的见解,并引发对多模态表示隐藏关系研究的更多兴趣。
引用
@article{arxiv.2309.05300,
title = {Decoupling Common and Unique Representations for Multimodal Self-supervised Learning},
author = {Yi Wang and Conrad M Albrecht and Nassim Ait Ali Braham and Chenying Liu and Zhitong Xiong and Xiao Xiang Zhu},
journal= {arXiv preprint arXiv:2309.05300},
year = {2024}
}
备注
Accepted to ECCV 2024. 27 pages, 8 figures