中文

全模态不一致基准:系统打破模态一致性以探测鲁棒性与校准性弃权

机器学习 2026-03-31 v1

摘要

现有全模态基准试图测量模态特定贡献,但其测量受到混淆:自然共现的模态携带相关但不等量的信息,使得结果难以反映真实模态依赖还是信息不对称。我们引入OMD-Bench,其中所有模态初始一致——每个模态呈现相同的锚点,即通过视频、音频和文本可独立感知的对象或事件——随后我们系统性地破坏各模态以隔离每个模态的贡献。我们还评估校准性弃权:模型在证据冲突时是否适当拒绝回答。该基准包含4,080个实例,涵盖27个锚点和八种破坏条件。在零样本和思维链提示下评估十个全模态模型,我们发现模型在两个模态被破坏时过度弃权,但在三个模态全部被破坏时严重弃权不足,同时在完全破坏下保持高置信度(约60-100%)。思维链提示改善了弃权与人类判断的对齐,但放大了过度自信而非缓解它。OMD-Bench为诊断模态依赖、跨模态不一致的鲁棒性以及全模态系统中的不确定性校准提供了基准工具。

关键词

引用

@article{arxiv.2603.27187,
  title  = {Omni-Modal Dissonance Benchmark: Systematically Breaking Modality Consensus to Probe Robustness and Calibrated Abstention},
  author = {Zabir Al Nazi and Shubhashis Roy Dipta and Md Rizwan Parvez},
  journal= {arXiv preprint arXiv:2603.27187},
  year   = {2026}
}