InfMasking:通过对比多模态交互释放协同信息
机器学习
2026-01-06 v4 人工智能
计算机视觉与模式识别
摘要
在多模态表示学习中,模态间的协同交互不仅提供互补信息,还通过任何单一模态都无法实现的特定交互模式产生独特结果。现有方法可能难以有效捕捉协同信息的全貌,导致在此类交互至关重要的任务中表现欠佳。这一问题尤为严重,因为协同信息构成了多模态表示的核心价值主张。为应对这一挑战,我们引入了 InfMasking,这是一种对比协同信息提取方法,旨在通过无限掩码策略增强协同信息。InfMasking 在融合过程中随机遮挡每个模态的大部分特征,仅保留部分信息,以创建具有不同协同模式的表示。然后通过互信息最大化将未掩码的融合表示与掩码表示进行对齐,以编码全面的协同信息。这种无限掩码策略通过在训练期间让模型接触多样的部分模态组合,使其能够捕捉更丰富的交互。由于在无限掩码下计算互信息估计在计算上是不可行的,我们推导出 InfMasking 损失来近似这一计算。通过对照实验,我们证明 InfMasking 能有效增强模态间的协同信息。在大规模真实数据集的评估中,InfMasking 在七个基准上达到了 SOTA 性能。代码发布于 https://github.com/brightest66/InfMasking。
引用
@article{arxiv.2509.25270,
title = {InfMasking: Unleashing Synergistic Information by Contrastive Multimodal Interactions},
author = {Liangjian Wen and Qun Dai and Jianzhuang Liu and Jiangtao Zheng and Yong Dai and Dongkai Wang and Zhao Kang and Jun Wang and Zenglin Xu and Jiang Duan},
journal= {arXiv preprint arXiv:2509.25270},
year = {2026}
}
备注
Conference on Neural Information Processing Systems (NeurIPS) 2025 (Spotlight)