中文

理解多模态深度线性网络中的单模态偏差

机器学习 2024-07-30 v2

摘要

同时使用多个输入流训练多模态神经网络直观上有利,但实际具有挑战性。一个关键挑战是单模态偏差,即网络在联合训练过程中过度依赖一种模态而忽略其他模态。我们发展了多模态深度线性网络中单模态偏差的理论,以理解架构和数据统计如何影响这种偏差。这是首次计算学习过程中单模态阶段的持续时间,作为模态在网络中融合的深度、数据集统计和初始化的函数。我们表明,融合发生的层越深,单模态阶段越长。在过参数化机制中,长的单模态阶段可能导致泛化缺陷和永久性单模态偏差。我们的结果针对多模态线性网络推导,但在某些设置下可扩展到非线性网络。总之,这项工作揭示了联合训练下多模态学习的病理现象,表明晚期和中间融合架构可能导致长的单模态阶段和永久性单模态偏差。我们的代码可在 https://yedizhang.github.io/unimodal-bias.html 获取。

关键词

引用

@article{arxiv.2312.00935,
  title  = {Understanding Unimodal Bias in Multimodal Deep Linear Networks},
  author = {Yedi Zhang and Peter E. Latham and Andrew Saxe},
  journal= {arXiv preprint arXiv:2312.00935},
  year   = {2024}
}

备注

ICML 2024 camera ready