中文

用于集成多模态感知的交替梯度下降与混合专家方法

计算机视觉与模式识别 2023-12-12 v2 人工智能 机器学习 多媒体 图像与视频处理

摘要

我们提出集成多模态感知(IMP),一种简单且可扩展的多模态多任务训练与建模方法。IMP将图像、视频、文本和音频等多模态输入集成到单个Transformer编码器中,仅使用极少的模态特定组件。IMP采用一种结合交替梯度下降(AGD)与混合专家(MoE)的新颖设计,以实现高效的模型与任务扩展。我们进行了广泛的实证研究并揭示了以下关键见解:1)通过在具有不同输入分辨率的多样模态、损失函数和任务上交替执行梯度下降更新,可高效提升模型性能。2)在单一模态无关编码器上采用MoE稀疏化显著提升了性能,优于使用模态特定编码器或额外融合层的稠密模型,并极大缓解了模态间的冲突。IMP在包括视频分类、图像分类、图文检索和视频文本检索在内的广泛下游任务上取得了具竞争力的性能。最值得注意的是,我们训练了一个专注于视频任务的稀疏IMP-MoE-L变体,在零样本视频分类上达到了新的最优性能:在Kinetics-400上为77.0%,在Kinetics-600上为76.8%,在Kinetics-700上为68.3%,分别将先前最优性能提升了+5%、+6.7%和+5.8%,而仅使用了其总训练计算成本的15%。

关键词

引用

@article{arxiv.2305.06324,
  title  = {Alternating Gradient Descent and Mixture-of-Experts for Integrated Multimodal Perception},
  author = {Hassan Akbari and Dan Kondratyuk and Yin Cui and Rachel Hornung and Huisheng Wang and Hartwig Adam},
  journal= {arXiv preprint arXiv:2305.06324},
  year   = {2023}
}