通过掩码建模揭示具有密集交互的音频-视觉早期融合Transformer的力量
计算机视觉与模式识别
2023-12-05 v1 人工智能
机器学习
多媒体
声音
摘要
人类具有整合听觉和视觉信息的卓越能力,从而能够更深入地理解周围环境。认知心理学和神经科学研究表明,这种音频和视觉线索的早期融合为开发多模态感知模型提供了巨大潜力。然而,训练早期融合架构面临重大挑战,因为模型表达能力的增强需要稳健的学习框架来利用其增强的能力。在本文中,我们利用先前在单模态设置中成功的掩码重建框架来训练具有早期融合的音频-视觉编码器。此外,我们提出了一种基于注意力的融合模块,该模块捕获局部音频和视觉表示之间的交互,增强了模型捕获细粒度交互的能力。虽然有效,但该过程可能变得计算上难以处理,因为局部表示的数量增加。因此,为了解决计算复杂度,我们提出了一种替代方法,即在表示音频-视觉交互之前对局部表示进行分解。在多个数据集上的广泛评估证明了我们的方法在音频事件分类、视觉声音定位、声音分离和音频-视觉分割方面的优越性。这些贡献使得深度集成的音频-视觉模型的高效训练成为可能,并显著推进了早期融合架构的实用性。
引用
@article{arxiv.2312.01017,
title = {Unveiling the Power of Audio-Visual Early Fusion Transformers with Dense Interactions through Masked Modeling},
author = {Shentong Mo and Pedro Morgado},
journal= {arXiv preprint arXiv:2312.01017},
year = {2023}
}