时间异构图对比学习用于多模态声学事件分类
声音
2025-09-19 v1 音频与语音处理
摘要
多模态声学事件分类在音频-视觉系统中扮演关键角色。虽然结合音频和视觉信号改善了识别效果,但在时间上对齐它们以及降低跨模态噪声的影响仍然很困难。现有方法通常分别处理音频和视频流,随后通过对比或互信息目标融合特征。近期的进展探索了多模态图学习,但大多数方法未能区分模态内和模态间的时间依赖关系。为此,我们提出了时间异构图对比学习(THGCL)。我们的框架为每个事件构建一个时间图,其中音频和视频片段形成节点,它们的时间链接形成边。我们引入高斯过程实现模态内平滑性,霍克斯过程实现模态间衰减,以及对比学习来捕捉细粒度关系。在AudioSet上的实验表明,THGCL达到了最先进的性能。
引用
@article{arxiv.2509.14893,
title = {Temporally Heterogeneous Graph Contrastive Learning for Multimodal Acoustic event Classification},
author = {Yuanjian Chen and Yang Xiao and Jinjie Huang},
journal= {arXiv preprint arXiv:2509.14893},
year = {2025}
}