MA-AVT:面向参数高效音频-视觉Transformer的模态对齐
计算机视觉与模式识别
2024-06-10 v1 多媒体
声音
音频与语音处理
摘要
最近预训练视觉Transformer的进展在无需音频预训练的参数高效音频-视觉学习中显示出前景。然而,很少有研究探讨在参数高效音频-视觉Transformer中对齐多模态特征的有效方法。在本文中,我们提出了MA-AVT,一种新的参数高效音频-视觉Transformer,采用深度模态对齐来对应多模态语义特征。具体来说,我们引入了联合单模态和多模态令牌学习,以使用冻结的模态共享Transformer对齐两种模态。这使得模型能够学习每种模态的单独表示,同时关注它们之间的跨模态关系。此外,与仅对齐单模态编码器输出的粗粒度特征的先前工作不同,我们引入了逐块对比学习,以在整个编码阶段对齐从粗到细的分层特征。此外,为了抑制每个模态中与前景匹配的音频-视觉特征中的背景特征,我们引入了一种鲁棒的判别性前景挖掘方案。通过在基准AVE、VGGSound和CREMA-D数据集上的大量实验,我们实现了比SOTA方法显著的性能提升。
引用
@article{arxiv.2406.04930,
title = {MA-AVT: Modality Alignment for Parameter-Efficient Audio-Visual Transformers},
author = {Tanvir Mahmud and Shentong Mo and Yapeng Tian and Diana Marculescu},
journal= {arXiv preprint arXiv:2406.04930},
year = {2024}
}
备注
Accepted in Efficient Deep Learning for Computer Vision CVPR Workshop 2024