重新审视音视觉学习中的预训练
计算机视觉与模式识别
2023-02-20 v2 多媒体
声音
音频与语音处理
摘要
预训练技术在提升模型在各种任务上的性能方面取得了巨大成功,但在某些单模态情境下被发现表现不如从头训练。这启发我们思考:在更复杂的多模态场景中,尤其是音频与视觉这类异构模态下,预训练模型是否总是有效的?我们发现答案是否定的。具体而言,我们探究了预训练模型在两种音视觉学习场景中的影响:跨模态初始化与多模态联合学习。当应用跨模态初始化时,由异常 Batchnorm 参数引起的“死通道”现象阻碍了模型容量的利用。为此,我们提出自适应 Batchnorm 重初始化(ABRi)以更好地挖掘预训练模型在目标任务上的容量。在多模态联合学习中,我们发现强大的预训练单模态编码器会对另一模态的编码器带来负面效应。为缓解该问题,我们引入两阶段融合微调(Fusion Tuning)策略,在更好地利用预训练知识的同时,使单模态编码器通过自适应掩码方法相互协作。实验结果表明,我们的方法能进一步挖掘预训练模型的潜力并提升音视觉学习中的性能。
引用
@article{arxiv.2302.03533,
title = {Revisiting Pre-training in Audio-Visual Learning},
author = {Ruoxuan Feng and Wenke Xia and Di Hu},
journal= {arXiv preprint arXiv:2302.03533},
year = {2023}
}