中文

基于典型相关图神经网络的多模态视听信息融合用于节能语音增强

声音 2022-09-19 v3 机器学习 音频与语音处理

摘要

本文提出了一种新颖的多模态自监督架构,用于节能的视听(AV)语音增强,该架构将图神经网络与典型相关分析(CCA-GNN)相集成。所提出的方法建立在最先进的 CCA-GNN 基础之上,后者通过最大化同一输入的两组增强视图之间的相关性,同时去相关不相连的特征,来学习具有代表性的嵌入。传统 CCA-GNN 的关键思想在于丢弃增强变异信息并保留增强不变信息,同时防止捕获冗余信息。我们提出的 AV CCA-GNN 模型处理多模态表示学习场景。具体而言,我们的模型通过最大化同一通道增强视图之间的典型相关以及音频与视觉嵌入之间的典型相关,改进了上下文 AV 语音处理。此外,它提出了一种位置节点编码,在计算节点最近邻时考虑先验帧序列距离而非特征空间表示,从而通过邻域连通性在嵌入中引入时间信息。在基准 ChiME3 数据集上的实验表明,我们提出的基于先验帧的 AV CCA-GNN 确保了时间上下文中更好的特征学习,从而比最先进的 CCA-GNN 和多层感知机实现更节能的语音重建。

关键词

引用

@article{arxiv.2202.04528,
  title  = {Multimodal Audio-Visual Information Fusion using Canonical-Correlated Graph Neural Network for Energy-Efficient Speech Enhancement},
  author = {Leandro Aparecido Passos and João Paulo Papa and Javier Del Ser and Amir Hussain and Ahsan Adeel},
  journal= {arXiv preprint arXiv:2202.04528},
  year   = {2022}
}