中文

跨模态提示:适配大规模预训练模型用于音视频下游任务

机器学习 2023-12-22 v2 人工智能 计算机视觉与模式识别 多媒体

摘要

近年来,在音视频下游任务中部署大规模预训练模型取得了显著成果。然而,这些主要在单模态无约束数据集上训练的模型,在多模态任务的特征提取中仍面临挑战,导致性能欠佳。该局限源于编码过程中引入了无关的模态特定信息,对下游任务性能产生不利影响。为应对此挑战,本文提出一种新颖的双引导空间-通道-时间(DG-SCT)注意力机制。该机制利用音频与视觉模态作为软提示,基于当前多模态输入特征动态调节预训练模型参数。具体而言,DG-SCT 模块将可训练的跨模态交互层嵌入预训练的音视频编码器中,从而在空间、通道和时间维度上自适应提取当前模态的关键信息,同时保持大规模预训练模型的冻结参数。实验评估表明,我们所提模型在 AVE、AVVP、AVS 和 AVQA 等多个下游任务上取得了最先进(SOTA)结果。此外,我们的模型在具有挑战性的少样本与零样本场景中展现出良好性能。源代码与预训练模型可在 https://github.com/haoyi-duan/DG-SCT 获取。

关键词

引用

@article{arxiv.2311.05152,
  title  = {Cross-modal Prompts: Adapting Large Pre-trained Models for Audio-Visual Downstream Tasks},
  author = {Haoyi Duan and Yan Xia and Mingze Zhou and Li Tang and Jieming Zhu and Zhou Zhao},
  journal= {arXiv preprint arXiv:2311.05152},
  year   = {2023}
}

备注

Accepted to NeurIPS 2023