推进对比语言-音频预训练的多粒度对齐
音频与语音处理
2024-08-16 v1
摘要
近期在音频-语言联合学习方面取得了显著进展,例如CLAP,在多模态理解任务中表现出色。这些模型通常将单模态局部表示(即帧特征或词特征)聚合为全局表示,并在其上使用对比损失以实现粗粒度的跨模态对齐。然而,帧级与文本的对应关系可能被忽略,使得问题在可解释性和细粒度挑战方面不适定,并可能损害粗粒度任务的性能。在本工作中,我们旨在改进对比式预训练中的粗粒度和细粒度音频-语言对齐。为统一两种模态的粒度和潜在分布,采用共享码本以共同基表示多模态全局特征,每个码字被正则化以编码模态共享语义,弥合帧特征与词特征之间的差距。基于此,引入局部感知模块以纯化局部模式,并设计硬负样本引导损失以增强对齐。在十一个零样本粗粒度和细粒度任务上的实验表明,我们的模型不仅显著超越了基线CLAP,而且在当前SOTA工作中也取得了优越或具有竞争力的结果。
引用
@article{arxiv.2408.07919,
title = {Advancing Multi-grained Alignment for Contrastive Language-Audio Pre-training},
author = {Yiming Li and Zhifang Guo and Xiangdong Wang and Hong Liu},
journal= {arXiv preprint arXiv:2408.07919},
year = {2024}
}
备注
ACM MM 2024 (Oral)