中文

标签所关乎的事:模态平衡与难度感知的多模态主动学习

计算机视觉与模式识别 2026-03-27 v1

摘要

多模态学习通过整合来自不同模态(如图像、文本和音频)的互补信息来提高模型性能,但其成功依赖于大规模标注数据,而标注成本较高。主动学习(AL)通过有选择地标注信息性样本来缓解这一挑战。在多模态场景中,许多方法隐含地假设模态重要性在各轮中保持稳定,并在融合阶段保持固定的选择规则,这使其对多模态学习的动态特性不敏感——即随着训练进行,模态的相对价值和实例的难度会发生变化。为此,我们提出了 RL-MBA(基于强化学习的模态平衡难度感知多模态主动学习框架)。RL-MBA将样本选择建模为马尔可夫决策过程,其中策略适应模态贡献、不确定性和多样性,奖励函数鼓励提升准确率和平衡性。两种关键组件驱动着这种适应性:(1)自适应模态贡献平衡(AMCB),通过强化反馈动态调整模态权重;(2)基于证据融合的难度感知策略调整(EFDA),通过基于不确定性的证据融合估计样本难度,以优先标注信息性样本。在Food101、KineticsSound和VGGSound数据集上的实验表明,RL-MBA consistently 优于强基线,提高了分类准确率和模态公平性,同时在有限标注预算下实现了显著提升。

关键词

引用

@article{arxiv.2603.25107,
  title  = {Label What Matters: Modality-Balanced and Difficulty-Aware Multimodal Active Learning},
  author = {Yuqiao Zeng and Xu Wang and Tengfei Liang and Yiqing Hao and Yi Jin and Hui Yu},
  journal= {arXiv preprint arXiv:2603.25107},
  year   = {2026}
}