中文

CM3T:面向非均匀交互数据集的高效多模态学习框架

计算机视觉与模式识别 2025-01-08 v1

摘要

交叉学习面临的挑战包括训练数据的不均匀甚至不足,以及缺乏重新训练大型预训练模型的资源。受 NLP 中迁移学习技术、适配器和前缀微调的启发,本文提出了一种用于交叉学习的新的模型无关插件架构,称为 CM3T,它将基于 Transformer 的模型适应于新的或缺失的信息。我们引入了两个适配器块:用于迁移学习的多头视觉适配器和用于多模态学习的交叉注意力适配器。由于主干网络和其他插件不需要与这些新增部分一起微调,训练变得非常高效。在 Epic-Kitchens-100、MPIIGroupInteraction 和 UDIVA v0.5 三个数据集上的对比和消融研究表明了该框架在不同记录设置和任务上的有效性。与主干网络相比,用于处理视频输入的可训练参数仅占 12.8%,而用于两种额外模态的可训练参数仅占 22.3%,我们取得了与 SOTA 相当甚至更好的结果。CM3T 对训练或预训练没有特定要求,是弥合通用模型与视频分类特定实际应用之间差距的一步。

关键词

引用

@article{arxiv.2501.03332,
  title  = {CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets},
  author = {Tanay Agrawal and Mohammed Guermal and Michal Balazia and Francois Bremond},
  journal= {arXiv preprint arXiv:2501.03332},
  year   = {2025}
}

备注

Preprint. Final paper accepted at the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), Tucson, February, 2025. 10 pages