中文

面向多模态分类的动态多模态信息瓶颈

图像与视频处理 2023-11-28 v3 计算机视觉与模式识别

摘要

有效利用诸如各类图像、实验室检验与临床信息等多模态数据,在多种基于 AI 的医学诊断与预后任务中正受到关注。现有多数多模态技术仅聚焦于通过利用各模态间的差异或共享特征并跨模态融合特征来提升性能。这些方法通常对临床环境并非最优,后者带来训练数据有限以及充斥冗余数据或噪声模态通道的额外挑战,导致性能不佳。为弥补此不足,我们研究了现有方法对数据冗余与噪声的鲁棒性,并提出一种广义动态多模态信息瓶颈框架以获得鲁棒融合特征表示。具体而言,我们的信息瓶颈模块用于滤除融合特征中与任务无关的信息与噪声,并进一步引入充分性损失以防止丢弃任务相关信息,从而显式保留精炼特征中预测信息的充分性。我们在一个内部及一个公开 COVID19 死亡率预测数据集以及两个公开生物医学诊断任务数据集上验证了模型。大量实验表明,我们的方法超越当前最先进的(SOTA)水平且显著更鲁棒,是唯一在存在大规模噪声通道时仍保持性能的方法。我们的代码公开于 https://github.com/ayanglab/DMIB。

关键词

引用

@article{arxiv.2311.01066,
  title  = {Dynamic Multimodal Information Bottleneck for Multimodality Classification},
  author = {Yingying Fang and Shuang Wu and Sheng Zhang and Chaoyan Huang and Tieyong Zeng and Xiaodan Xing and Simon Walsh and Guang Yang},
  journal= {arXiv preprint arXiv:2311.01066},
  year   = {2023}
}

备注

WACV 2024