中文

通过多尺度功能熵正则化降低多模态语义分割中的单模态偏差

计算机视觉与模式识别 2025-05-13 v1

摘要

融合和平衡来自新型传感器的多模态输入进行密集预测任务,尤其是语义分割,至关重要且仍然是一个显著挑战。一个主要局限性在于,多模态框架倾向于过度依赖容易学习的模态,这被称为单模态主导或偏差。在现实场景中,当主导模态不可用时,这会导致严重的性能下降。为此,我们应用了一种简单而有效的即插即用正则化项,基于功能熵,既不引入额外参数也不添加模块。该项旨在直观地平衡每个视觉模态对分割结果的贡献。具体而言,我们利用对数索布拉不等式将功能熵上界限制为功能-费马尔信息。通过最大化由每个视觉模态贡献的信息,我们的方法缓解了单模态主导,构建了一个更加平衡和稳健的分割框架。提出了一个多尺度正则化模块,用于对高层特征以及分割预测应用所提出的即插即用项,以实现更平衡的多模态学习。大量实验在三个数据集上证明,我们的方法取得了优异的性能,即在没有引入任何额外参数的情况下分别提升了 +13.94%、+3.25% 和 +3.64%。

关键词

引用

@article{arxiv.2505.06635,
  title  = {Reducing Unimodal Bias in Multi-Modal Semantic Segmentation with Multi-Scale Functional Entropy Regularization},
  author = {Xu Zheng and Yuanhuiyi Lyu and Lutao Jiang and Danda Pani Paudel and Luc Van Gool and Xuming Hu},
  journal= {arXiv preprint arXiv:2505.06635},
  year   = {2025}
}