中文

TMac:用于声学事件分类的时序多模态图学习

声音 2023-09-27 v2 机器学习 多媒体 音频与语音处理

摘要

在数字时代,视听数据无处不在,这对在其上开发的深度学习模型提出了更高要求。妥善处理多模态数据的信息是构建更优视听模型的关键。我们观察到这些视听数据天然具有时间属性,例如视频中每帧的时间信息。更具体地,此类数据依据音频与视觉线索天然是多模态的,并按严格时间顺序进行。这表明在时间信息对模态内与模态间的多模态声学事件建模中十分重要。然而,现有方法独立处理各模态特征并简单融合,忽视了时间关系的挖掘,从而导致次优性能。受此启发,我们提出一种用于声学事件分类的时序多模态图学习方法,称为 TMac,通过图学习技术对这类时间信息建模。具体而言,我们为每个声学事件构建时序图,将其音频与视频数据划分为多个片段。每个片段可视作一个节点,节点间的时间关系可视作其边上的时间戳。如此,我们可顺畅捕捉模态内与模态间的动态信息。若干实验表明 TMac 性能优于其他 SOTA 模型。我们的代码见 https://github.com/MGitHubL/TMac。

关键词

引用

@article{arxiv.2309.11845,
  title  = {TMac: Temporal Multi-Modal Graph Learning for Acoustic Event Classification},
  author = {Meng Liu and Ke Liang and Dayu Hu and Hao Yu and Yue Liu and Lingyuan Meng and Wenxuan Tu and Sihang Zhou and Xinwang Liu},
  journal= {arXiv preprint arXiv:2309.11845},
  year   = {2023}
}

备注

This work has been accepted by ACM MM 2023 for publication