中文

剖析 RGB-D 学习以改进多模态融合

计算机视觉与模式识别 2025-06-17 v2

摘要

在 RGB-D 视觉领域,大量研究集中于设计多模态学习策略与融合结构。然而,RGB-D 模型中的互补与融合机制仍是一个黑箱。在本文中,我们提出一种分析框架与一种新评分来剖析 RGB-D 视觉领域。我们的方法包括跨模态与跨层级度量所提出的语义方差与特征相似度,并通过综合实验对多模态学习进行可视化与量化分析。具体而言,我们考察了跨模态特征的一致性与特异性、各模态内部的演化规律,以及优化 RGB-D 模型时所采用的协作逻辑。我们的研究揭示/验证了若干重要发现,例如跨模态特征的差异与混合多模态协作规则,后者同时为互补推理凸显一致性与特异性。我们还展示了所提 RGB-D 剖析方法的通用性,并基于我们的发现引入一种直接的融合策略,其在各类任务乃至其他多模态数据上均带来显著提升。

关键词

引用

@article{arxiv.2308.10019,
  title  = {Dissecting RGB-D Learning for Improved Multi-modal Fusion},
  author = {Hao Chen and Haoran Zhou and Yunshu Zhang and Zheng Lin and Yongjian Deng},
  journal= {arXiv preprint arXiv:2308.10019},
  year   = {2025}
}