跨模态提示:适配大规模预训练模型用于音视频下游任务
机器学习
2023-12-22 v2 人工智能
计算机视觉与模式识别
多媒体
摘要
近年来,在音视频下游任务中部署大规模预训练模型取得了显著成果。然而,这些主要在单模态无约束数据集上训练的模型,在多模态任务的特征提取中仍面临挑战,导致性能欠佳。该局限源于编码过程中引入了无关的模态特定信息,对下游任务性能产生不利影响。为应对此挑战,本文提出一种新颖的双引导空间-通道-时间(DG-SCT)注意力机制。该机制利用音频与视觉模态作为软提示,基于当前多模态输入特征动态调节预训练模型参数。具体而言,DG-SCT 模块将可训练的跨模态交互层嵌入预训练的音视频编码器中,从而在空间、通道和时间维度上自适应提取当前模态的关键信息,同时保持大规模预训练模型的冻结参数。实验评估表明,我们所提模型在 AVE、AVVP、AVS 和 AVQA 等多个下游任务上取得了最先进(SOTA)结果。此外,我们的模型在具有挑战性的少样本与零样本场景中展现出良好性能。源代码与预训练模型可在 https://github.com/haoyi-duan/DG-SCT 获取。
引用
@article{arxiv.2311.05152,
title = {Cross-modal Prompts: Adapting Large Pre-trained Models for Audio-Visual Downstream Tasks},
author = {Haoyi Duan and Yan Xia and Mingze Zhou and Li Tang and Jieming Zhu and Zhou Zhao},
journal= {arXiv preprint arXiv:2311.05152},
year = {2023}
}
备注
Accepted to NeurIPS 2023