基于表示解耦的鲁棒多模态学习
计算机视觉与模式识别
2024-07-08 v1 人工智能
摘要
鲁棒于缺失模态的多模态学习因其实际应用价值而受到越来越多关注。现有方法通常通过学习不同模态组合的共同子空间表示来解决此问题,但我们发现这些方法次优,由于对类内表示的隐式约束。具体而言,同一类别中不同模态的样本将被迫学习相同方向上的表示,这会阻碍模型捕获模态特定信息,从而导致学习不足。为此,我们提出一种新型解耦型多模态表示网络(DMRNet),以实现鲁棒的多模态学习。具体而言,DMRNet 将来自不同模态组合的输入建模为概率分布而非潜空间中的固定点,并从分布中采样嵌入用于预测模块计算任务损失。结果,来自损失最小化的方向约束被采样表示所屏蔽。这放松了对推断表示的约束,使模型能够捕获不同模态组合的特定信息。此外,我们引入硬组合正则化,以防止 DMRNet 训练不平衡,引导其更关注困难的模态组合。最后,在多模态分类和分割任务上进行的大量实验表明,所提出的 DMRNet 在性能上显著优于现有方法。
引用
@article{arxiv.2407.04458,
title = {Robust Multimodal Learning via Representation Decoupling},
author = {Shicai Wei and Yang Luo and Yuji Wang and Chunbo Luo},
journal= {arXiv preprint arXiv:2407.04458},
year = {2024}
}
备注
ECCV2024 17 pages