基于对比式事件-对象对齐与语义融合的视听场景分类
声音
2022-08-04 v1 多媒体
音频与语音处理
图像与视频处理
摘要
以往关于场景分类的工作主要基于音频或视觉信号,而人类通过多种感官感知环境场景。近期关于视听场景分类的研究分别在目标数据集上微调大规模的音频与图像预训练模型,随后要么融合音频模型与视觉模型的中间表示,要么在片段层级融合两个模型的粗粒度决策。此类方法忽略了视听场景(AVS)中细粒度的音频事件与视觉对象,而人类常通过其中的音频事件、视觉对象及其之间的一致性来辨识不同场景。为利用AVS中音频事件与视觉对象的细粒度信息,并协调二者间的隐含关系,本文提出一种配备对比式事件-对象对齐(CEOA)与基于语义的融合(SF)的多分支模型用于AVSC。CEOA旨在通过比较视听事件-对象对之间的差异来对齐所学得的音频事件与视觉对象嵌入。随后,与特定音频事件相关联的视觉对象及反之的音频事件经交叉注意力强化,并经由SF进行语义级融合。实验表明:1)所提出的配备CEOA与SF的AVSC模型优于仅音频与仅视觉模型,即视听结果优于单模态结果;2)CEOA在细粒度层面对齐音频事件与相关视觉对象的嵌入,且SF有效整合二者;3)与其他大规模集成系统相比,即便未使用额外数据集与数据增强技巧,所提模型仍展现出具竞争力的性能。
引用
@article{arxiv.2208.02086,
title = {Audio-visual scene classification via contrastive event-object alignment and semantic-based fusion},
author = {Yuanbo Hou and Bo Kang and Dick Botteldooren},
journal= {arXiv preprint arXiv:2208.02086},
year = {2022}
}
备注
IEEE MMSP 2022