中文

用于视听语音增强的多层特征融合卷积网络

音频与语音处理 2022-05-24 v3 声音 图像与视频处理

摘要

语音增强有可能从目标说话人的视觉信息(如唇部运动与面部表情)中获益,因为语音的视觉方面本质上不受声学环境的影响。在本文中,我们通过视听(AV)神经处理来解决从视频中增强受损语音信号的问题。近期多数 AV 语音增强方法分别处理声学与视觉特征,并通过简单的拼接操作融合它们。尽管该策略方便且易实现,却有两个主要缺陷:1)语音感知中的证据表明,人类中的 AV 整合发生于极早阶段,而先前模型在早期分别处理两种模态并仅在后期结合,从而使系统鲁棒性较差;2)简单拼接无法控制声学与视觉模态信息被处理的方式。为克服这些缺陷,我们提出多层特征融合卷积网络(MFFCN),其在编码阶段分别处理声学与视觉模态以保留各模态特征,同时逐层融合两模态特征,以契合人类 AV 语音感知。此外,考虑到两模态间的平衡,我们设计通道与谱注意力机制,为处理不同类型信息提供额外灵活性,扩展卷积神经网络的表征能力。实验结果表明,所提 MFFCN 的网络性能优于最先进的模型。

关键词

引用

@article{arxiv.2101.05975,
  title  = {Multi-layer Feature Fusion Convolution Network for Audio-visual Speech Enhancement},
  author = {Xinmeng Xu and Jianjun Hao},
  journal= {arXiv preprint arXiv:2101.05975},
  year   = {2022}
}