基于博弈论正则化的多模态训练平衡
机器学习
2025-10-02 v3 人工智能
计算机视觉与模式识别
计算机科学与博弈论
多媒体
摘要
多模态学习通过捕捉数据源间的依赖关系,有望实现更丰富的信息提取。然而,当前的训练方法常因模态竞争而表现不佳,这是一种模态争夺训练资源导致部分模态欠优化的现象。这引出一个关键问题:如何解决训练不平衡,确保所有模态得到充分优化,并在从单模态向多模态过渡时实现持续的性能提升?本文提出了多模态竞争正则化器(MCR),其灵感源于一种旨在防止多模态训练中竞争不利影响的互信息(MI)分解。我们的主要贡献包括:1)一个博弈论框架,通过鼓励每个模态在最终预测中最大化其信息作用,自适应地平衡模态贡献;2)细化每个 MI 项的上下界,以增强跨模态任务相关独特信息与共享信息的提取;3)提出用于条件 MI 估计的潜在空间排列,显著提高计算效率。MCR 优于所有先前建议的训练策略和简单基线,明确表明联合训练模态能在合成和大规模真实数据集上带来重要的性能增益。我们在 https://github.com/kkontras/MCR 发布代码和模型。
引用
@article{arxiv.2411.07335,
title = {Balancing Multimodal Training Through Game-Theoretic Regularization},
author = {Konstantinos Kontras and Thomas Strypsteen and Christos Chatzichristos and Paul Pu Liang and Matthew Blaschko and Maarten De Vos},
journal= {arXiv preprint arXiv:2411.07335},
year = {2025}
}
备注
23 pages, 7 figures, 6 tables, 1 algorithm