中文

通过秩目标融合抵消多模态表示坍塌

计算机视觉与模式识别 2026-02-24 v2 机器学习

摘要

多模态融合方法常常 suffer 于两种表示坍塌:特征坍塌(即各维度丢失判别能力,由特征谱衡量)和模态坍塌(即单一主导模态压倒其他模态)。需要融合多种传感器数据的应用(如人体动作预测)受到特征与模态坍塌的双重制约。然而,现有方法试图分别应对特征坍塌和模态坍塌。这源于缺乏一种能高效统一处理特征与模态坍塌的框架。本文认为有效秩(effective rank)作为一种信息性度量,可用于量化与抵消两种表示坍塌。我们提出了“提升秩标记融合器”(Rank-enhancing Token Fuser),这是一种在理论上得到验证的融合框架, selectively 将一个模态中信息不足的特征与另一个模态中互补的特征进行融合。我们展示了该方法增加了融合表示的有效秩。为解决模态坍塌,我们评估了能够相互提升彼此有效秩的模态组合。我们表明,深度信息在与 RGB 融合时能维持表征平衡,避免模态坍塌。在动作预测任务上,我们呈现了“深度信息感知融合框架”(R3D)。在 NTURGBD、UTKinect 和 DARai 数据集上进行大量实验,证明我们的方法在多个指标上比以前的 SOTA 方法高出最高 3.74%。我们的代码已公开:https://github.com/olivesgatech/R3D。

关键词

引用

@article{arxiv.2511.06450,
  title  = {Countering Multi-modal Representation Collapse through Rank-targeted Fusion},
  author = {Seulgi Kim and Kiran Kokilepersaud and Mohit Prabhushankar and Ghassan AlRegib},
  journal= {arXiv preprint arXiv:2511.06450},
  year   = {2026}
}

备注

Accepted in 2026 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV)