中文

BTW:多模态模型集成的非参数方差稳定框架

机器学习 2025-08-27 v1

摘要

混合专家(Mixture-of-Experts, MoE)模型在多模态学习中日益增强的功效,使其能够通过模块化跨模态专长实现。然而,当额外模态引入更多噪声而非互补信息时,其有效性尚不明了。现有方法如部分信息分解(Partial Information Decomposition)在超越两种模态时难以扩展,且缺乏对实例级控制的分辨力。我们提出超越两种模态加权(Beyond Two-modality Weighting, BTW),一种双层非参数加权框架,融合实例级 KL 散度与模态级互信息,以动态调整训练期间的模态重要性。该方法无需额外参数,可适用于任意数量的模态。具体而言,BTW 通过衡量每个单模态预测与当前多模态预测之间的发散程度计算每例 KL 权重,通过估计单模态输出与多模态输出之间的全局对齐度计算模态范围的 MI 权重。在情感回归和临床分类实验中,我们的方法显著提升了回归性能和多类分类准确率。

关键词

引用

@article{arxiv.2508.18551,
  title  = {BTW: A Non-Parametric Variance Stabilization Framework for Multimodal Model Integration},
  author = {Jun Hou and Le Wang and Xuan Wang},
  journal= {arXiv preprint arXiv:2508.18551},
  year   = {2025}
}