推断时动态模态选择用于不完整多模态分类
计算机视觉与模式识别
2026-05-14 v3
摘要
多模态深度学习(MDL)在各个领域取得了显著的成功,但实际部署常常因不完整的多模态数据而受到阻碍。现有的不完整MDL方法要么丢弃缺失的模态,风险在于丢失宝贵的任务相关信息;要么恢复这些模态,可能引入无关的噪声,导致丢弃-插补的困境。为解决这一困境,本文提出了DyMo——一种推断时动态模态选择框架,通过自适应识别并融合可靠的恢复模态,充分探索传统丢弃或插补范式之外的任务相关信息。DyMo的核心是一种新颖的选择算法,用于最大化每个测试样本的多模态任务相关信息。由于在测试时数据分布未知,直接估计此类信息不可行,因此我们在理论上建立了信息与任务损失之间的联系,将其在推断时作为可计算的代理指标。基于此,我们提出了新的原则性奖励函数以引导模态选择。此外,我们设计了一种兼容任意模态组合的灵活多模态网络架构,并制定了针对稳健表征学习的量身定制的训练策略。在多样化的自然图像和医学图像数据集上进行的广泛实验表明,DyMo在各种缺失数据场景下均显著优于现有的SOTA不完整/动态MDL方法。我们的代码已公开于https://github.com//siyi-wind/DyMo。
引用
@article{arxiv.2601.22853,
title = {Inference-Time Dynamic Modality Selection for Incomplete Multimodal Classification},
author = {Siyi Du and Xinzhe Luo and Declan P. O'Regan and Chen Qin},
journal= {arXiv preprint arXiv:2601.22853},
year = {2026}
}
备注
27 pages (including appendix), accepted by ICLR 2026