M2-CLIP:面向视频动作识别的多模态多任务适配框架
计算机视觉与模式识别
2024-01-23 v1
摘要
近年来,大规模视觉语言预训练模型(如CLIP)的兴起,结合参数高效微调(PEFT)技术,在视频动作识别领域引起了广泛关注。然而,现有方法往往优先追求强监督性能,而牺牲了模型在迁移过程中的泛化能力。本文提出一种新颖的多模态多任务CLIP适配框架M2-CLIP,以应对这些挑战,同时保持高监督性能和强迁移性。首先,为增强各模态架构,我们在视觉和文本分支中引入多模态适配器。具体地,我们设计了一种新颖的视觉TED-Adapter,执行全局时间增强和局部时间差异建模,以提升视觉编码器的时间表示能力。此外,我们采用文本编码器适配器来加强语义标签信息的学习。其次,我们设计了一个具有丰富监督信号的多任务解码器,以巧妙满足多模态框架中对强监督性能和泛化能力的需求。实验结果验证了我们方法的有效性,在监督学习中展现出卓越性能,同时在零样本场景中保持强泛化能力。
引用
@article{arxiv.2401.11649,
title = {M2-CLIP: A Multimodal, Multi-task Adapting Framework for Video Action Recognition},
author = {Mengmeng Wang and Jiazheng Xing and Boyuan Jiang and Jun Chen and Jianbiao Mei and Xingxing Zuo and Guang Dai and Jingdong Wang and Yong Liu},
journal= {arXiv preprint arXiv:2401.11649},
year = {2024}
}